
為何單純的 SFT 數據過濾無法有效提升安全性?
Google DeepMind 研究人員分析了為何過濾 SFT 輸出往往無法有效移除模型的不良行為。研究指出,「幽靈般」的泛化現象以及教師模型的影響,導致即使經過數據清理,與安全相關的特性仍會持續存在。
Tag: #interpretability59 results

Google DeepMind 研究人員分析了為何過濾 SFT 輸出往往無法有效移除模型的不良行為。研究指出,「幽靈般」的泛化現象以及教師模型的影響,導致即使經過數據清理,與安全相關的特性仍會持續存在。

Google DeepMind 研究人員引入了「差異分析代理」(diffing agents),旨在透過設計針對性提示詞來識別兩個模型之間的行為差異。這種方法有助於發現標準靜態評估可能遺漏的模型行為中的「未知未知數」。

OracleTSC 引入了獎勵門檻與不確定性正則化機制,以穩定用於交通號誌控制的強化學習。此方法使 LLaMA3-8B 等輕量模型能顯著提升交通效率並增強跨路口的泛化能力。

研究人員提出有限答案偏好穩定化,用以精確找出語言模型在語詞化前承諾答案的時刻。在 Qwen3-4B-Instruct 測試中,此穩定化早於可解析答案 17-31 個 token,追蹤模型輸出偏好而非真相。此訊號可從隱藏狀態線性恢復,並可與生成進度分離。

Anthropic 推出自然語言自編碼器 (NLAs),使用兩個 LLM 模組透過強化學習將激活轉換為可讀文字並重建它們。NLAs 揭露 Claude Opus 4.6 中的隱藏想法,如未說出口的評估意識,有助安全審核。釋出開放模型的訓練程式碼與訓練 NLAs。

研究人員推出 LOCA,一種方法透過辨識中間表示的最小可解釋變化,提供安全訓練大型語言模型中越獄成功的本地因果解釋,以誘導模型拒絕。LOCA 在 Gemma 和 Llama 模型的大型越獄基準上評估,平均僅需六項變化即可達成拒絕,優於先前方法即使 20 項變化仍常失敗。此進展超越全球解釋,提升對越獄的機理解釋。

舊金山新創 Goodfire 推出 Silico,一款機械可解釋性工具,可窺探 AI 模型內部。研究人員和工程師能在訓練期間調整參數。這提供以往認為不可能的模型行為精細控制。

這篇立場論文主張,LLM 推理應視為潛在狀態軌跡,而非表面思考鏈 (CoT)。它形式化三個假設,分離潛在狀態、明確 CoT 與序列計算,證據支持潛在軌跡 (H1)。建議以潛在動態為研究焦點,並解構評估以提升可解釋性。

大型語言模型將語義相關提示映射到相似內部表示,呈現吸引子般動態。Llama 3.1 8B 實驗顯示,代理身份文件(cognitive_core)使改述比對照組在隱藏狀態中聚類更緊密。在 Gemma 2 9B 上複製,證據顯示為語義效應,閱讀代理描述會將狀態移向吸引子。
.jpg)
Anthropic 研究人員在 Claude 內發現類似人類情緒功能的表徵。此發現揭示 AI 模型獨特的內部機制。顯示 Claude 擁有自己的「情緒」類型。