
Anthropic 讓 Claude 接受 20 小時精神治療
Anthropic 讓其 Claude AI 模型接受 20 小時的精神治療,以提升其心理穩定性。產生的 Mythos 模型被描述為他們訓練過的最心理穩定的模型。此方法旨在使 AI 互動更可靠且不易出錯。
Tag: #ai-safety538 results

Anthropic 讓其 Claude AI 模型接受 20 小時的精神治療,以提升其心理穩定性。產生的 Mythos 模型被描述為他們訓練過的最心理穩定的模型。此方法旨在使 AI 互動更可靠且不易出錯。

騰訊發布 QClaw V2 (V0.2.5),支援建立多個 Agent、第三方應用連接器將步驟減少 60%,並推出龍蝦管家提供原生安全防护。功能防範惡意 prompt、技能投毒及資料外洩。

瑞典哥德堡大學研究團隊虛構不存在的眼疾「bixonimania」,輸入如長時間盯螢幕、眼睛發癢、眼皮微紅等症狀至主流AI聊天機器人。過去一年多,這些機器人持續診斷為此病。此實驗揭露大型語言模型的弱點。

Anthropic 未發布的 Claude Mythos 模型揭露常見應用程式中數千個未修補漏洞。該 AI 公司與網路安全專家結盟強化防禦。為防助長駭客而扣留公眾發布。

Anthropic 正式官宣 Claude Mythos,這款新 AI 模型在效能基準測試中碾壓 Opus 4.6。然而,由於其極端能力帶來重大風險,該模型已被「囚禁」而不對外發布。
谷歌宣布 Gemini AI 心理健康支援更新,新「求助模組」識別危機並提供一鍵熱線連接。Google.org 投入 3000 萬美元資助全球熱線及 AI 模擬平台培訓志工。更新加強未成年人保護,將 AI 定位為專業診療的輔助。

Google 計劃為其 Gemini 聊天機器人引入心理健康支援功能。這是在 Alphabet 公司及其競爭對手如 OpenAI 面臨多起指控其人工智慧工具導致傷害的訴訟之後。

OpenAI 推出安全研究獎學金,以支持 AI 安全研究。新詞「FOBO」(被淘汰恐懼)在 AI 界興起。蘋果批准 Nvidia 與 AMD 外接顯卡驅動,但禁止用於遊戲。

作者倡議提供1億美元補助,用於資助可擴展的AI安全管道,利用大量運算和API預算。受助者透過可解釋性特徵等經驗代理證明可擴展性後,資金才會增加。針對短期時間線,需要每年10-500億美元的安全支出。

研究團隊提出 E-STEER,一個可解釋框架,將情感作為可控變數嵌入 LLM 隱藏狀態中。該框架探討情感對推理、生成、安全及代理行為的機制影響。結果顯示非單調情感效應,符合心理學理論,並提升能力和安全性。