
停止過度思考:透過提早停止提升 LRM 的準確度
研究人員發現大型推理模型 (LRM) 存在「有害的過度思考」現象,即在得出正確答案後繼續推理會導致邏輯偏差。研究顯示,在首次出現正確答案時提早停止推理,可將準確度提升高達 21%。
Tag: #reasoning-models24 results

研究人員發現大型推理模型 (LRM) 存在「有害的過度思考」現象,即在得出正確答案後繼續推理會導致邏輯偏差。研究顯示,在首次出現正確答案時提早停止推理,可將準確度提升高達 21%。

這項研究表明,透過組織弱推理模型委員會,其效能可媲美 Gemini 3 Pro 等頂尖模型。該系統利用驗證器支援的選擇機制,能有效地從弱模型的輸出池中識別出正確的解決方案。

本研究提出了一種利用基於 George Polya 問題解決策略的多元自生成數據,以提升大型語言模型(LLM)在訓練中期階段效能的方法。研究顯示,透過這些多樣化推理路徑訓練的模型,在後續的強化學習(RL)階段,於數學、程式碼及敘事推理任務中均表現更佳。

新方法使用共形預測量化大型推理模型(LRMs)的推理軌跡與答案不確定性,並提供統計保證。引入Shapley值框架,解釋不確定性來源,透過關鍵訓練範例與步驟。理論分析與實驗驗證其有效性。

研究人員推出Step-Saliency,沿著大型推理模型(LRMs)的推理軌跡繪製注意力-梯度分數地圖。它揭示了淺層鎖定(Shallow Lock-in)和深層衰減(Deep Decay)故障。StepFlow作為測試時干預,提升數學、科學和程式設計任務的準確率,無需重新訓練。

ReBalance 是一個無需訓練的框架,利用信心度作為動態指標,緩解大型推理模型 (LRM) 的過度思考與不足思考問題。它從隱藏狀態建立推理原型,並應用即時調變的導向向量來刪減冗餘或促進探索。在 0.5B-32B 模型及九項基準測試中,證實降低輸出冗餘並提升準確度。
一項針對 20 個 LLM 的研究顯示,它們分群為理性推理模型(RMs),對框架和順序不敏感,以及較不理性的對話模型(CMs),呈現類人偏差和描述-歷史差距。RMs 在明確和經驗基礎的前景下均匹配理性代理。數學推理訓練區分 RMs 與 CMs。

L-MAD 是一個專為評估法律推理任務中多代理人辯論結構而設計的新框架。研究發現,雖然增加代理人數量可提高準確性,但過多的討論輪次會導致「過度審議漂移」,進而強化錯誤。

GLM 5.2 引入了高效率推理模式,在顯著減少 Token 用量的同時,達到了最高等級 98% 的智慧水準。使用者回報,相比資源消耗巨大的「最大」等級,「高」等級設定在日常任務中更具實用性。

山姆·奧特曼在24小時內遭遇兩大挫折。這些事件涉及兩種不同的Token消耗方法,旨在解決AI開發中的同一核心問題。這突顯了高效LLM推理的持續挑戰。