Search

Tag: #interpretability59 results

大型語言模型除錯系統化方法

大型語言模型除錯系統化方法

這篇論文提出一種系統化、模型無關的大型語言模型(LLM)除錯方法,將其視為可觀測系統。提供從問題偵測到模型精煉的結構化方法,統一評估、可解釋性和錯誤分析。即使缺乏標準化基準,此方法仍能實現弱點的迭代診斷、提示精煉及資料調整。

🤖

CT 掃描揭露 LLM 情緒處理機制

Activation Lab (llmct) 在生成期間擷取 LLM 每層內部狀態,用於可解釋性。於 Qwen 2.5 (3B) 的 20 輪情緒對話實驗中,殘差流維持 0.83-0.88 餘弦相似度的情緒骨幹。主要發現:情緒辨識高峰在第 29-33 層、內建平靜緩衝、喜悅偏好、記憶衰減。

Reddit r/MachineLearningCommunityApr 23#interpretability#llm-internals#emotional-ai
LLM 代理時間概念的共形可解釋性

LLM 代理時間概念的共形可解釋性

研究人員提出共形可解釋性框架,用以解碼 LLM 代理在序列任務中內部表示的時間概念。它使用逐步獎勵建模與共形預測,將激活標記為成功或失敗,然後訓練線性探針識別如推理漂移等關鍵方向。在 ScienceWorld 和 AlfWorld 的實驗證實線性可分離性,並展示用於提升效能的導向潛力。

「神經疊加計算複雜度」入門介紹

「神經疊加計算複雜度」入門介紹

這篇文章提供理論機器學習論文「神經疊加計算複雜度」的入門概述。介紹神經元多義性問題,即單一神經元對無關概念同時激活,並解釋高維空間中使用近正交向量實現疊加,引用 Johnson-Lindenstrauss 引理。提及 2022 年代表疊加研究,用於 LLM 可解釋性。

AI Alignment ForumCommunityApr 22#superposition#polysemanticity#interpretability
🤖

Prisma:具新型FFN閘門的車庫模型

開發者 y3i12 發布 Prisma,這是受可解釋性啟發的架構,與標準 Transformer 不同。主要創新包括注意力/輸出權重共享、巢狀 FFN 閘門,以及 Word-Relative RoPE。在單一 H100 上以 30B 權重訓練,資料效率提升 25%,基準測試表現不錯。

Reddit r/MachineLearningCommunityMar 11#interpretability#position-embedding
Page 5 of 6