
測量 LLM 將推理算力花在哪裡
SARE 是一套在單一 Chain-of-Thought 步驟層級測量計算努力的框架,不再只評估整段推理軌跡。針對六個基準測試與三個開放權重 LLM 的評估顯示,推理能量會因步驟類型而異,錯誤解答在關鍵節點的能量較低,且其表現可超越基於輸出的信心訊號。
Tag: #interpretability59 results

SARE 是一套在單一 Chain-of-Thought 步驟層級測量計算努力的框架,不再只評估整段推理軌跡。針對六個基準測試與三個開放權重 LLM 的評估顯示,推理能量會因步驟類型而異,錯誤解答在關鍵節點的能量較低,且其表現可超越基於輸出的信心訊號。
這款互動式工具視覺化了 GPT-2-small 嵌入空間中的 32,070 個字母 Token。使用者可以探索最近鄰關係,並透過 t-SNE 佈局瀏覽整個圖譜。

本研究將潛在思維鏈(Latent CoT)推理建模為表徵空間中的軌跡,並應用動力系統分析來理解 CODI 和 COCONUT 等模型的推理演化過程。研究識別出不同的穩定性行為,為提升潛在推理方法的解釋性與效能提供了新框架。

本文探討了 Claude 神經架構中出現的神秘、未經編程的能力。文中強調了目前針對這些模型「未被構建」部分如何運作的持續研究。

這項研究介紹了一種透過 LLM 從對話記錄中提取並聚類語義特徵的方法,無需存取模型內部結構即可識別模型行為。該方法為行為分析提供了一種比傳統稀疏自動編碼器 (SAE) 更簡單且無監督的替代方案。

研究人員對 DiffusionGemma 進行了透明度審計,並將其可解釋性與標準的自回歸模型(如 Gemma)進行了比較。雖然變數透明度相當,但由於其非時間順序的擴散推理過程,該模型在演算法透明度方面提出了獨特的挑戰。

GLARE 是一個基於 LLM 的互動式介面,允許使用者使用自然語言查詢黑盒影像分類器的全域解釋。該系統將使用者查詢轉換為 SQL 以聚合局部解釋數據,並提供統計增強的回答與視覺化圖表。
Concept-Vector 是一個旨在將標準詞嵌入轉換為人類可解釋向量的設計框架。它允許將向量組件映射到語法或語義等特定標籤,旨在提高模型的可解釋性。

本研究提出了一種「詮釋性審計管道」(Interpretive Audit Pipeline),以解決基於準確度的標準 LLM 評估方法的侷限性。透過將模型間的分歧視為診斷工具,該框架能識別出需要人工介入的模糊公眾意見。

研究人員推出註解者政策模型 (APMs),這是可解釋模型,僅從標註行為推斷註解者的內部安全政策。APM 達到超過 80% 準確率,能預測反事實回應,並辨識人類與 LLM 註解中的政策模糊性和價值多元性。這有助於無需額外標註成本,即實現更透明且包容的 AI 安全政策設計。