
為何自信犯錯的 LLM 可能保持穩定
本研究探討「穩定失準」現象:大型語言模型產生自信但錯誤的答案,且在提示詞輕微變動下仍維持穩定。在多個領域與開放權重模型中,自我批判提示降低了隱藏狀態敏感度,但未能可靠區分自信錯誤與正確答案。
Tag: #calibration5 results

本研究探討「穩定失準」現象:大型語言模型產生自信但錯誤的答案,且在提示詞輕微變動下仍維持穩定。在多個領域與開放權重模型中,自我批判提示降低了隱藏狀態敏感度,但未能可靠區分自信錯誤與正確答案。
研究人員開發了一種透過繞過 Anthropic 研究中提到的「可口語化工作空間」(J-space) 來改善 LLM 信心校準的方法。透過對隱藏狀態使用線性探針,模型無需修改核心權重即可輸出校準後的信心分數。

蘋果研究人員發現,僅以權杖訓練的基礎LLM,在開放領域問答任務中使用基於抽樣的度量,展現出強大的語義校準。即使未經明確訓練,它們也能提供超越權杖層級的可靠信心估計。一個理論機制解釋了此現象的出現。

研究人員將LLM不確定性估計指標的代理失效形式化,這些指標在低資訊情境中失效。他們提出Truth AnChoring (TAC),一種後處理校準方法,使用噪音少樣本監督將分數對齊事實真相。TAC實現可靠幻覺偵測;程式碼在GitHub。

探討工業測量系統(如 CNC 機床與感測器)中精度、準確度、重複定位精度與解析度的技術定義。