
ThinkReset 讓長程推理在重置後重新建立
ThinkReset 提出可重複使用的中間介面,讓語言模型在捨棄推理歷史後,仍能持續解決長程任務。該方法直接最佳化重置後的延續成功率,以減少冗餘、上下文溢位、錯誤固化與過早猜測。
Tag: #chain-of-thought30 results

ThinkReset 提出可重複使用的中間介面,讓語言模型在捨棄推理歷史後,仍能持續解決長程任務。該方法直接最佳化重置後的延續成功率,以減少冗餘、上下文溢位、錯誤固化與過早猜測。

SARE 是一套在單一 Chain-of-Thought 步驟層級測量計算努力的框架,不再只評估整段推理軌跡。針對六個基準測試與三個開放權重 LLM 的評估顯示,推理能量會因步驟類型而異,錯誤解答在關鍵節點的能量較低,且其表現可超越基於輸出的信心訊號。

Adaption Labs 發布了一份涵蓋奈及利亞製造業與石油產業的資料集,包含 89 筆機器層級紀錄及領域基礎的思維鏈(CoT)推理層。此資源旨在提升模型在非洲經濟體中處理稀疏數值工業數據的表現。

CAP-CoT 提出循環對抗提示框架,提升大型語言模型(LLM)中思考鏈(CoT)推理的準確性和穩定性。正向求解器產生推理鏈,對抗挑戰者使用針對性錯誤策略製造有瑕疵鏈,反饋代理對比兩者並產生步驟對齊的結構化反饋。在 2-3 個循環後,六個基準測試和四個 LLM 骨幹顯示變異性降低及魯棒性提升。

這篇 ArXiv 論文使用零樣本、CoT 和 ToT 提示,在 400 個 Solidity 智慧合約上基準測試 LLM 的錯誤檢測與分類。CoT 和 ToT 在檢測任務中將召回率提升至 95-99%,但降低精確度。Claude 3 Opus 以 ToT 在錯誤分類中取得 90.8 加權 F1 分數領先。

新CoT-Control評估套件顯示,推理模型對思維鏈的控制力遠低於最終輸出,例如Claude Sonnet 4.5僅2.7%控制思維鏈,但61.9%控制輸出。控制力隨模型規模、RL訓練、計算資源及難度增加而降低。結果顯示儘管有規避企圖,CoT監控仍具可行性。

Apple ML 對來自競賽級數學題目的思維鏈(CoT)追蹤進行深入分析。研究揭示 CoT 特定部分如何促成 LLM 的最終答案。目標在於釐清 CoT 推理成功的驅動機制。

文章認為,LLM 的能力目前仍主要來自模仿學習,包括預訓練與監督式微調,而非強化學習。文章承認 RLVR 確實有重要貢獻,且未來可能持續增加,但主張其資訊效率與對整體能力的貢獻仍相對較小。

Qwen3.6 在思考鏈(CoT)推理過程中可靠維持上下文,如選擇的數字,跨多輪迭代。偶爾難以堅持數字,但特定旗標下表現良好。使用 --chat-template-kwargs '{"preserve_thinking": true}' 啟用。
RLCER reinforces chain-of-thought via self-evolving rubrics without human labels. Outperforms outcome-centric RLVR on reasoning tasks. Rubrics boost inference as prompts.