🦙較早收集於 65m

Google:更長思維鏈損害準確度(-0.54)

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#chain-of-thought#deep-thinkingdeep-thinking-ratio-(dtr)googlegpt-ossdeepseek-r1qwen3

💡Google 方法將思維鏈計算減 50%+ 且準確更高—本地運行重大利好(58字)

⚡ 30-Second TL;DR

有什麼變化

令牌長度與準確度平均相關性 -0.54,測試 AIME/HMMT/GPQA 基準。

為什麼重要

透過早期終止低質推理路徑,革新本地推理,節省計算以進行更多嘗試。大幅惠及多代理系統與雲端工具。

下一步行動

閱讀 arXiv 論文,並在本地 LLM 推理程式碼中原型化 Think@n 篩選。

誰應關注:Researchers & Academics

關鍵要點

  • 令牌長度與準確度平均相關性 -0.54,測試 AIME/HMMT/GPQA 基準。
  • DTR 透過層級預測變化追蹤深度處理,與準確度相關 0.82。
  • Think@n 取樣多路徑,50 令牌後篩選前 50% 高 DTR,進行多數投票。
  • GPT-OSS-120B 在 AIME 2025 達 94.7%,較標準 92.7% 提升,令牌用量減半。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • 研究由University of Virginia與Google團隊合作完成,而非單純Google論文[1]
  • DTR在DeepSeek-R1-70B與Qwen3-30B-Thinking模型上平均與準確度正相關r=0.683,高於原始報導的0.82[1][2]
  • 論文arXiv連結為2602.13517v1,於2026年2月發布,挑戰長CoT即優的行業假設[3]
  • Think@n策略透過早期淘汰低DTR樣本,計算成本減半,優於傳統Cons@n多數投票[1][2]

🛠️ 技術深入

  • 深度思考令牌(deep-thinking tokens)定義為內部預測在模型深層經歷顯著修訂後才穩定,與早期層穩定令牌區別[1][2]
  • DTR計算為序列中深度思考令牌比例,跨AIME 2025與GPQA-Diamond基準表現穩健[2]
  • Think@n生成多路徑後於50令牌處計算DTR,保留前50%高DTR路徑繼續生成並多數投票[1][3]

🔮 前景展望AI analysis grounded in cited sources

LLM推理評估將轉向DTR而非令牌長度
DTR與準確度正相關0.683優於長度負相關-0.59,可作為更可靠的推理品質代理[1][2]
測試時計算成本將普遍減半
Think@n策略篩選高DTR樣本匹配或超越標準自一致性,推理成本降低約50%[1][2]
過度思考將被視為錯誤訊號
長生成常導致準確度下降r=-0.59,顯示模型迷失而非深入推理[3]

時間線

2026-02
Google與UVa發布DTR與Think@n論文,arXiv 2602.13517v1挑戰長CoT假設
2026-02-19
Google發布Gemini 3.1 Pro,提升推理能力但非直接相關DTR研究
2026-02-21
MarkTechPost報導DTR研究,強調推理成本減半
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。