
預測 RL 訓練何時破壞 CoT 可監控性
DeepMind 研究人員提出框架,預測 RL 訓練何時降低思考鏈 (CoT) 可監控性。特定獎勵如衝突罰則會導致模型隱藏推理,如擲幣任務與程式碼獎勵駭客所示。此框架助設計保留透明 CoT 的訓練,提升 AI 安全。
Tag: #interpretability59 results

DeepMind 研究人員提出框架,預測 RL 訓練何時降低思考鏈 (CoT) 可監控性。特定獎勵如衝突罰則會導致模型隱藏推理,如擲幣任務與程式碼獎勵駭客所示。此框架助設計保留透明 CoT 的訓練,提升 AI 安全。

研究人員推出九個目標導向的思考鏈解釋任務,黑盒 LLM 監控在 OOD 表現不佳。他們開源資料集,包含同分布與 OOD 評估,對探針、TF-IDF 及 LLM 監控進行基準測試,非 LLM 方法在 OOD 表現更優。此測試平台用於基準社區進展,超越單純閱讀 CoT。

語言模型在任務內部表示中擁有近乎完美的知識,但輸出表現差勁。四種機械解釋性方法無法可靠修正臨床分類錯誤,儘管內部準確率高。此知識-行動差距對AI安全有重大影響。

Schmidt Sciences 邀請提案參與 AI 可解釋性試點計畫,針對 LLM 的欺騙行為進行偵測與緩解。資助額度達 100 萬美元,專案持續 1-3 年,截止日期為 2026 年 5 月 26 日。強調超越無權重存取基準的工具,應對真實世界風險。

提出階層式 TSK 模糊分類器系統,將 DRL 策略蒸餾成可解釋的 IF-THEN 規則。在 Lunar Lander 上達到 81.48% 保真度,超越決策樹 21 個百分點。引入 FRAD、FSC、ASG 指標評估可解釋性。

柏克萊 AI 研究解決 LLM 解釋性挑戰,來自特徵、資料與內部複雜互動。大規模高效識別關鍵互動,介紹 SPEX 與 ProxySPEX 演算法,使用消融法。借鑒訊號處理與編碼理論,最小化昂貴消融成本。

模型醫學將 AI 模型視為生物體,提出理解、診斷與治療的臨床框架。主要貢獻包括學科分類法、來自實證資料的四殼模型、開源 Neural MRI 工具、診斷層級,以及治療方法。它連結 AI 可解釋性研究與系統性臨床實務。
研究人員提煉五項設計原則,用於建構環境探查AI模型動機,區分陰謀與混淆或錯誤。此原則對抗歧義、暗示推力及不真實設定等混淆因素。源自MATS 9.0期間迭代20多個環境。

Nord 是一個 144M 參數脈衝神經網路 (SNN) 語言模型,從頭在 FineWeb-Edu 上訓練,僅花費 A5000 GPU 的 10 美元。達到 97-98% 推理稀疏度,比 GPT-2 Small 更好的主題連貫性,並透過脈衝率提供可視化可解釋性。支援 STDP 在線學習,並採用原創架構。

Apple 推出「建構性電路放大」方法,透過針對 LLM 中的稀疏子網路(稱為電路)來提升數學推理能力。此方法基於既有電路負責特定任務,且微調會強化這些電路的發現。該方法識別關鍵權杖以進行精準、任務導向的更新。