
LLM 推理:潛在狀態,而非思考鏈
這篇立場論文主張,LLM 推理應視為潛在狀態軌跡,而非表面思考鏈 (CoT)。它形式化三個假設,分離潛在狀態、明確 CoT 與序列計算,證據支持潛在軌跡 (H1)。建議以潛在動態為研究焦點,並解構評估以提升可解釋性。
Tag: #reasoning112 results

這篇立場論文主張,LLM 推理應視為潛在狀態軌跡,而非表面思考鏈 (CoT)。它形式化三個假設,分離潛在狀態、明確 CoT 與序列計算,證據支持潛在軌跡 (H1)。建議以潛在動態為研究焦點,並解構評估以提升可解釋性。
在 Hugging Face 發布全新 10 萬樣本 Chain-of-Thought 數據集,用於微調本地推理模型。每樣本含明確中間推理軌跡以提升一致性。徵求 CoT 長度、風格及對小型模型影響的反饋。

SPPO 是一種可擴展演算法,提升 Proximal Policy Optimization (PPO) 用於對齊大型語言模型 (LLM) 在長視野推理任務上。它將過程重構為序列級上下文盜賊問題,使用解耦標量價值函數產生穩定、低變異優勢信號,而無需多重取樣。實驗顯示它超越標準 PPO,並在數學基準上匹配計算密集方法。

Anthropic 在 Claude 平台推出顧問工具。它使用 Opus 進行進階推理,成本低廉。開發者可透過 Messages API 呼叫。

新型神經符號架構從 ARC 格網提取物件結構,透過神經先驗提出 DSL 轉換,並以跨範例一致性過濾假設。它將 ARC-AGI-2 上基底 LLM 效能從 16% 提升至 24.4%,結合 ARC Lang Solver 達 30.8%。該開源系統無需任務特定微調或強化學習。
Gemma 4 (26B MoE 與 31B 密集) 在最大努力提示下高效推理達 10 分鐘破解密碼。不同於短思考,模型避免幻覺答案。提示可匹敵 Qwen3.5 與封閉模型。

DST 引入輕量級即插即用預測器,作為監督式啟發式引導 LLM 中的思維樹(ToT)搜尋。它實現動態、情境感知的剪枝,在簡單步驟近似貪婪效率,在複雜情況自適應擴展。評估顯示在推理基準上準確率與基準相當或優越,計算量減少 26-75%。
結合 Qwen3.5、Claude-4.6 和 Opus 的全新推理蒸餾模型 v2 現已在 Hugging Face 上線。社群熱切期待 27B 參數版本。經 r/LocalLLaMA Reddit 貼文分享。
開發者讚揚 Qwen 3.5 122B-A10B 在本地應用建置中的自然推理能力。模型透過分析現有 API 路由進行自我引導規劃。強調開放本地 LLM 的強大威力。

Apple 的 Multilingual Reasoning Gym 擴展原 Reasoning Gym,能在 14 種語言生成可驗證推理問題。它包含 94 項任務的翻譯模板,由母語人士在 10 種語言驗證,並調整以確保語言自然性。此健身房保留程序化生成無限實例與可調難度,適合強化學習。