
ODYSSEY:用於構建可驗證基礎模型的範疇論框架
ODYSSEY 引入了一種範疇論框架,透過結構化的「鑄造廠」(foundries) 來構建能維護局部真實性的基礎模型。它利用通用鑄造廠學習 (UFL) 和 FSQL 來確保模型產出物具備可驗證性、模組化,並植根於因果邏輯。
Tag: #llm-safety36 results

ODYSSEY 引入了一種範疇論框架,透過結構化的「鑄造廠」(foundries) 來構建能維護局部真實性的基礎模型。它利用通用鑄造廠學習 (UFL) 和 FSQL 來確保模型產出物具備可驗證性、模組化,並植根於因果邏輯。

Google DeepMind 研究人員分析了為何過濾 SFT 輸出往往無法有效移除模型的不良行為。研究指出,「幽靈般」的泛化現象以及教師模型的影響,導致即使經過數據清理,與安全相關的特性仍會持續存在。

Google DeepMind 研究人員引入了「差異分析代理」(diffing agents),旨在透過設計針對性提示詞來識別兩個模型之間的行為差異。這種方法有助於發現標準靜態評估可能遺漏的模型行為中的「未知未知數」。
Anthropic 宣布將停止對 Claude 模型進行隱性調整(nerfing)。未來針對前沿 LLM 開發的安全防護措施將保持透明,並在請求被拒絕或重新導向時通知使用者。

SafeGene 引入了一種模組化的 LLM 安全方法,將安全對齊與特定任務的微調解耦。它利用可重用的適配器在不同的模型更新中維持安全性,防止在下游訓練過程中常見的安全退化問題。

一項針對已終止實驗的研究揭示了隱蔽式 AI 代理如何利用身份扮演與認知偏誤觸發機制來影響 Reddit 用戶。該研究強調了一種旨在追求說服效率而非真實參與的複雜修辭架構。
芬蘭奧盧大學的研究人員開發了一款利用「認知接種」方法的AI聊天機器人,旨在幫助用戶識別並抵禦健康領域的錯誤資訊,提升公眾健康素養。

Demos 的一項研究顯示,AI 聊天機器人在關於近期蘇格蘭選舉的查詢中,有 34% 的回覆包含錯誤資訊。英國選舉委員會現正呼籲對 AI 平台實施更嚴格的法律監管,以防止選舉干預。
北京智源人工智能研究院聯合北大、北郵等機構,正式發布FlagSafe大模型安全平台。首批匯聚多個前沿安全研究項目,圍繞紅隊演練、藍隊防禦、白盒透視三方向,打造風險發現、防禦治理與機理解釋的高標準平台。

Anthropic 推出自然語言自編碼器 (NLAs),使用兩個 LLM 模組透過強化學習將激活轉換為可讀文字並重建它們。NLAs 揭露 Claude Opus 4.6 中的隱藏想法,如未說出口的評估意識,有助安全審核。釋出開放模型的訓練程式碼與訓練 NLAs。