
為何 Qwen3.8 的中間軌跡不是真正推理
這篇文章主張,不應將 Qwen3.8 的中間 token 解讀為類似人類的推理。文章引用研究指出,推理軌跡的有效性往往與答案正確性無關,而使用損壞或無關軌跡訓練的模型,表現可能與甚至優於使用有效軌跡訓練的模型。
Tag: #reasoning-traces7 results

這篇文章主張,不應將 Qwen3.8 的中間 token 解讀為類似人類的推理。文章引用研究指出,推理軌跡的有效性往往與答案正確性無關,而使用損壞或無關軌跡訓練的模型,表現可能與甚至優於使用有效軌跡訓練的模型。

SELFDOUBT 提出單次通過的不確定性框架,利用對沖-驗證比率 (HVR) 從推理軌跡中提取,用於推理 LLM。它無需 logits 或多重取樣,適合專有 API。評估顯示無對沖跡線達 96% 精確度,全分數以 10 倍低成本超越語義熵。
ARC 第三輪資料集與技術報告發布,分析頂尖模型推理軌跡。發現高表現模型可能訓練於類 ARC 資料。前沿模型得分低於 1%,前兩輪獎金因效率不足仍未領取。
一則 Reddit 貼文討論一篇論文,該論文聲稱某種漏洞或資訊缺口可揭露 proprietary Claude 與 GPT API 的推理 token。討論指出,這可能影響基準測試解讀、模型蒸餾,以及 proprietary 與開源推理模型之間的比較。

研究人員開發出一種從 Claude、GPT 和 Gemini 提取推理痕跡的技術。他們的發現顯示,部分中國 AI 系統可能曾以領先的美國模型作為訓練來源。

Apple ML 對來自競賽級數學題目的思維鏈(CoT)追蹤進行深入分析。研究揭示 CoT 特定部分如何促成 LLM 的最終答案。目標在於釐清 CoT 推理成功的驅動機制。

本文將可觀測性視為評估與除錯 AI Agent 的基礎,涵蓋推理流程追蹤、失敗調查,以及運用效能洞察改善 Agent 行為。