
CASE 預測何時隱藏狀態選擇勝過多數投票
研究人員提出 CASE,透過從 LLM 隱藏狀態擷取的線性正確性訊號來選擇答案。其新的可解碼性指標能預測此方法何時勝過多數投票,在中等難度問題上最高提升 19 個百分點。
Tag: #hidden-states6 results

研究人員提出 CASE,透過從 LLM 隱藏狀態擷取的線性正確性訊號來選擇答案。其新的可解碼性指標能預測此方法何時勝過多數投票,在中等難度問題上最高提升 19 個百分點。

本研究探討「穩定失準」現象:大型語言模型產生自信但錯誤的答案,且在提示詞輕微變動下仍維持穩定。在多個領域與開放權重模型中,自我批判提示降低了隱藏狀態敏感度,但未能可靠區分自信錯誤與正確答案。
研究人員開發了一種透過繞過 Anthropic 研究中提到的「可口語化工作空間」(J-space) 來改善 LLM 信心校準的方法。透過對隱藏狀態使用線性探針,模型無需修改核心權重即可輸出校準後的信心分數。

一項機制研究推翻視覺語言模型(VLMs)中注意力-信心假設,顯示注意力圖與正確性相關性極低(R=0.001)。隱藏狀態幾何與因果電路是更強的可靠性指標。晚融合模型如 LLaVA 脆弱,而早融合 PaliGemma 與 Qwen2-VL 更穩健。

Self-Routing 提出一種無參數 MoE 層路由機制,直接使用 token 隱藏狀態的指定子空間作為專家 logits,消除學習路由器。它在 GPT-2 規模語言建模和 ImageNet-1K 分類上匹配學習路由器性能,並具備更好的專家平衡。結果顯示路由熵高 17%,無需負載平衡損失。

SARE 是一套在單一 Chain-of-Thought 步驟層級測量計算努力的框架,不再只評估整段推理軌跡。針對六個基準測試與三個開放權重 LLM 的評估顯示,推理能量會因步驟類型而異,錯誤解答在關鍵節點的能量較低,且其表現可超越基於輸出的信心訊號。