
大型語言模型除錯系統化方法
這篇論文提出一種系統化、模型無關的大型語言模型(LLM)除錯方法,將其視為可觀測系統。提供從問題偵測到模型精煉的結構化方法,統一評估、可解釋性和錯誤分析。即使缺乏標準化基準,此方法仍能實現弱點的迭代診斷、提示精煉及資料調整。
Tag: #interpretability59 results

這篇論文提出一種系統化、模型無關的大型語言模型(LLM)除錯方法,將其視為可觀測系統。提供從問題偵測到模型精煉的結構化方法,統一評估、可解釋性和錯誤分析。即使缺乏標準化基準,此方法仍能實現弱點的迭代診斷、提示精煉及資料調整。

提出一管線,使用類別變分自編碼器將Wi-Fi CSI壓縮為離散潛在表示,接著進行因果發現與LTL規則萃取,建構符號化HAR分類器。達到競爭性效能,具完整可解釋性,無黑盒組件。可符號化多天線融合,無需重新訓練編碼器。
Activation Lab (llmct) 在生成期間擷取 LLM 每層內部狀態,用於可解釋性。於 Qwen 2.5 (3B) 的 20 輪情緒對話實驗中,殘差流維持 0.83-0.88 餘弦相似度的情緒骨幹。主要發現:情緒辨識高峰在第 29-33 層、內建平靜緩衝、喜悅偏好、記憶衰減。

研究人員提出共形可解釋性框架,用以解碼 LLM 代理在序列任務中內部表示的時間概念。它使用逐步獎勵建模與共形預測,將激活標記為成功或失敗,然後訓練線性探針識別如推理漂移等關鍵方向。在 ScienceWorld 和 AlfWorld 的實驗證實線性可分離性,並展示用於提升效能的導向潛力。
這篇文章提供理論機器學習論文「神經疊加計算複雜度」的入門概述。介紹神經元多義性問題,即單一神經元對無關概念同時激活,並解釋高維空間中使用近正交向量實現疊加,引用 Johnson-Lindenstrauss 引理。提及 2022 年代表疊加研究,用於 LLM 可解釋性。

研究團隊提出 E-STEER,一個可解釋框架,將情感作為可控變數嵌入 LLM 隱藏狀態中。該框架探討情感對推理、生成、安全及代理行為的機制影響。結果顯示非單調情感效應,符合心理學理論,並提升能力和安全性。

受限雙路徑神經架構在64項三段論基準上分離直覺與審議路徑。審議達到 r=0.8152 相關性,高於直覺的 r=0.7272,在拒絕回應及特定結論上有顯著進步。可解釋性顯示稀疏、差異化的內部狀態,符合類似推理的組織。

華人統計學家蘇炜杰獲得統計學最高榮譽。他主張AI需要一門新的數學語言。他將優化AI黑盒比喻為剝洋蔥。
開發者 y3i12 發布 Prisma,這是受可解釋性啟發的架構,與標準 Transformer 不同。主要創新包括注意力/輸出權重共享、巢狀 FFN 閘門,以及 Word-Relative RoPE。在單一 H100 上以 30B 權重訓練,資料效率提升 25%,基準測試表現不錯。
字节Seed團隊以化學概念重新詮釋AI推理,將DeepSeek-R1的神經路徑拆解為分子結構。思維鏈變成分子組裝,深度推理類似共價鍵。