📄ArXiv AI•較早收集於 15h
停止過度思考:透過提早停止提升 LRM 的準確度

💡了解為什麼讓您的 LLM 「思考」太久,實際上可能會損害模型的準確度。
⚡ 30-Second TL;DR
有什麼變化
引入前綴級協議來衡量推理充分性。
為什麼重要
這項研究挑戰了「更多運算時間等於更好推理」的假設。這表明開發者應優先考慮「推理效率」,而非僅僅增加 Token 預算來提升模型可靠性。
下一步行動
在您的推理管線中實作監控層,一旦模型達到高信心的正確狀態,即觸發提早停止機制。
誰應關注:Researchers & Academics
關鍵要點
- •引入前綴級協議來衡量推理充分性。
- •區分了冗餘的「囉唆」過度思考與有害的「邏輯漂移」。
- •在首次正確答案處停止推理可提升高達 21% 的準確度。
- •邏輯漂移與視覺重新詮釋是導致正確後出現錯誤的主要原因。
🧠 深度解析
Web-grounded analysis with 14 cited sources.
🔑 增強重點摘要
- •大型推理模型 (LRM) 存在「逆向擴展」(inverse scaling) 現象,即增加推理步驟反而可能降低準確度。此外,研究也發現「推理-行動困境」,模型難以平衡內部模擬與實際行動,導致「分析癱瘓」、「錯誤行動」或「過早放棄」等過度思考模式。
- •先進的提早停止方法利用模型內部的「信心躍升」或答案熵值來判斷停止時機。當模型對某個答案的內部信心急劇增加或不確定性顯著下降時,推理過程便會停止,這些方法通常無需額外訓練。
- •「前綴一致性」或「起始鎖定效應」(Beginning Lock-in Effect, BLE) 指出,推理過程的早期步驟(前綴)包含強烈的信號,能有效預測最終答案的正確性。這意味著優化這些初始推理片段,可以顯著影響後續推理軌跡和整體準確度。
- •原始文章中提及的「視覺重新詮釋」問題,是多模態大型語言模型 (LLM) 在處理視覺輸入時面臨的普遍挑戰。這些模型往往過度依賴文本資訊,難以有效利用視覺細節,即使是簡單的圖像問題也可能導致誤解或幻覺。
🛠️ 技術深入
- 基於熵的提早停止 (HALT-CoT):在每個推理步驟後,計算候選答案機率分佈的香農熵。一旦熵值降至預設閾值以下,表示模型不確定性已足夠低,推理過程便提早終止。此方法無需額外訓練且與模型無關。
- 基於答案收斂的提早停止 (ES-CoT):追蹤模型在每個推理步驟後輸出的「階段性答案」連續相同次數(運行長度)。當運行長度顯著增加並超過最小閾值時,推理終止。
- 信心躍升檢測 (Confidence Leaps):識別答案機率突然大幅增加的「信心躍升」時刻,將其作為模型達到洞察力的標誌,並在此時停止生成。這是一種無需訓練且與模型無關的啟發式方法。
- 前綴一致性引導 (PoLR):透過聚類推理軌跡的短前綴來識別主導集群,並僅擴展該集群中的路徑,以利用早期推理步驟中包含的強烈預測信號,從而提高計算效率。
- 序列分組衰減獎勵策略優化 (S-GRPO):華為提出,將單一完整推理路徑分段截斷為多個「提早退出推理」分支,並採用指數衰減獎勵機制,鼓勵模型盡早得出正確答案,越早退出且正確的答案獲得越高獎勵。
- 足夠思考 (JET):一種基於強化學習的訓練方法,旨在訓練模型主動終止不必要的推理。它透過截斷模型生成的軌跡來產生縮短的軌跡,並應用質量控制的長度獎勵。
🔮 前景展望AI analysis grounded in cited sources
未來大型推理模型將普遍內建自動停止機制,顯著降低運算成本並提升實用性。
隨著「過度思考」問題被廣泛認識及多種提早停止技術的成熟,這些機制將成為模型部署的標準配置,優化資源利用。
AI模型將發展出更精細的「自我意識」或元認知能力,以更好地判斷何時停止推理或調整策略。
對於「信心躍升」和「前綴一致性」等現象的深入理解,將促使模型開發者設計更複雜的內部監控機制,模仿人類的洞察力。
針對多模態推理中的「視覺重新詮釋」問題,將出現專門的早期停止或校正機制。
由於多模態模型在處理視覺資訊時的固有缺陷,未來研究將更專注於識別和糾正視覺輸入導致的邏輯漂移,以提高跨模態任務的準確性。
⏳ 時間線
2025-02
提出「推理-行動困境」:研究指出大型推理模型在內部模擬與實際行動之間難以平衡,導致「分析癱瘓」等過度思考模式。
2025-05
AutoThink策略提出:中國科學院自動化研究所提出AutoThink,透過省略號提示和三階段強化學習,讓大模型自主決定是否及如何思考,減少冗餘推理。
2025-05
華為S-GRPO方法提出:華為提出S-GRPO,透過「序列分組衰減獎勵策略優化」解決思維鏈中的「冗餘思考」瓶頸,提高推理效率和準確性。
2025-09
ES-CoT (Early Stopping Chain-of-thoughts) 提出:一種在推理時透過檢測答案收斂來縮短思維鏈生成的方法,平均減少約41%的推理token使用量。
2026-01
PoLR (Path of Least Resistance) 提出:利用前綴一致性來實現計算高效的推理,透過聚類短前綴並擴展主導集群的路徑,減少高達60%的token使用量。
2026-03
Confidence Leaps in LLM Reasoning: Early Stopping and Cross-Model Transfer 論文發表:發現LLM在推理過程中常出現「信心躍升」,並基於此提出無需訓練、與模型無關的提早停止啟發式方法。
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗