
繪製黑箱 LLM 的決策脈絡
研究人員提出一種與模型無關的解釋器,用於說明提示中的個別句子如何影響黑箱 LLM 產生指定輸出。該方法透過 Energy-Based Model 建立替代模型,訓練完成後可獨立運作,無需再次呼叫 API。
Tag: #interpretability59 results

研究人員提出一種與模型無關的解釋器,用於說明提示中的個別句子如何影響黑箱 LLM 產生指定輸出。該方法透過 Energy-Based Model 建立替代模型,訓練完成後可獨立運作,無需再次呼叫 API。
研究人員尋求將醫學影像自動編碼器中的特定潛在特徵圖映射回輸入影像的方法。目前嘗試使用遮罩和解碼隔離特徵的方法,但受到解碼器糾纏問題的困擾。
提出對 Karvonen 50M 參數西洋棋 transformer(經轉錄文字預測訓練)的可解釋性實驗。透過輸入不可能走法測試因果棋盤狀態,涵蓋違規梯度:規則、軌跡、威脅、指涉。分析探針一致性、預測、熵。
3D 可視化工具在推論期間動畫顯示 LLM 組件如注意力層、FFN 和 KV 快取的激活路徑。節點強度反映 token 生成時的即時活動。尋求回饋:是否有助建立直覺或過度簡化過程。
BSc 學生使用堆疊自編碼器進行 Kaggle PCA 轉換信用卡資料的无監督欺詐檢測,透過重建誤差標記。套用自訂 SHAP 解釋 V14 和 V17 等特徵對 MSE 的貢獻。尋求驗證此抽象 XAI 方法是否值得作為論文貢獻,儘管特徵已匿名化。
Reddit r/MachineLearning 貼文引用 Goodfire 的 X 貼文,展示注意力探針可實現早期 CoT 退出以降低 token 成本。貼文質疑此類可解釋性技術是否應用於模型預訓練,或 SFT/RL 後訓練階段。
新手研究者詢問會議發表機器學習論文標準,主題為使用宏觀變數預測股票指數,結果穩健但預測力小。應用 SHAP 於隨機森林模型,發現制度轉移問題。思考是否定位為可解釋性診斷工具以提高錄取機會。
CRL uses reinforcement learning to select sparse autoencoder (SAE) features for steering language models at each token, revealing which features impact outputs. It includes adaptive masking for diverse features and enables analysis like branch point tracking and layer-wise comparisons. Tested on Gemma-2 2B, it improves benchmarks while providing interpretable logs.
Lightweight adapters trained on interpretability artifacts enable reliable self-interpretation in frozen LMs. A simple scalar affine adapter outperforms baselines in feature labeling, topic identification, and implicit reasoning decoding. Gains scale with model size, driven mostly by learned bias.