
為何 Qwen3.8 的中間軌跡不是真正推理
這篇文章主張,不應將 Qwen3.8 的中間 token 解讀為類似人類的推理。文章引用研究指出,推理軌跡的有效性往往與答案正確性無關,而使用損壞或無關軌跡訓練的模型,表現可能與甚至優於使用有效軌跡訓練的模型。
Tag: #chain-of-thought30 results

這篇文章主張,不應將 Qwen3.8 的中間 token 解讀為類似人類的推理。文章引用研究指出,推理軌跡的有效性往往與答案正確性無關,而使用損壞或無關軌跡訓練的模型,表現可能與甚至優於使用有效軌跡訓練的模型。

Preferred Networks 發布 PLaMo 3.0 Prime β版,這是日本首款完全從零打造的大規模語言模型。它參考 DeepSeek R-1 等手法,支持「長考」推理功能,效能逼近 Qwen3-235B 和 gpt-oss-120b。這是國內不依賴既有模型的 LLM 開發里程碑。
Llama 3.1 8B 使用結構化思考鏈和圖形上下文壓縮,在無微調情況下於多跳 QA 基準上匹配或超越 Llama 3.3 70B。檢索成功率達 77-91%,但推理是瓶頸。在 HotpotQA、MuSiQue 和 2WikiMultiHopQA 上測試,Groq 上成本降低 12 倍。

研究人員證明,前沿模型的加密思維鏈區塊可被重放至較弱模型,並以明文重建。此漏洞可能以低成本促成模型蒸餾、隱私洩露、有害內容曝光與提示注入發現。

研究人員引入了「干預式基礎審計」(interventional grounding audits),用於測試 LLM 在思維鏈推理過程中是否真正依賴於既定前提。透過將謂詞替換為新符號,該方法能識別出模型即便推理過程存在缺陷或邏輯斷層,仍能得出正確答案的情況。

VeryTrace 引入了一種零樣本框架,將自然語言推理轉換為結構化、可編譯的表示形式,以檢測並修復邏輯錯誤。透過結合確定性檢查與目標導向的 LLM 審核,它在數學與機器人等複雜領域中提升了準確性,且無需額外訓練。

TTE-Flash 引入了「潛在思考標記」(latent think tokens)來取代顯式的思維鏈生成,大幅降低了多模態嵌入的計算開銷。該模型在 MMEB-v2 基準測試中表現優異,同時保持了固定的推理成本。

如 DeepSeek-R1 等模型的思考鏈推理,在多選 QA 中會隨著軌跡長度增加位置偏誤。在 MMLU、ARC-Challenge 和 GPQA 的 13 種配置中,偏誤與長度呈正相關(0.11-0.41)。截斷測試證實因果關係,建議評估不預設順序穩健性。

Apple研究展示大型語言模型(LLMs)在測試時計算中執行中間鏈式思考(CoT)推理,以提升生成答案前的思考能力。透過自一致性作為思考必要性的代理,探討模型能力、查詢複雜度與最佳預算分配的關係,以實現計算最優推理。增加思考預算可平滑提升效能,但需了解最佳配置。

Apple 的 LaDiR 框架將潛在擴散模型與 LLM 整合,提升思維鏈推理能力。它克服自迴歸解碼限制,在連續潛在空間中實現整體權重標記精煉。這促進多樣推理解決方案的高效探索。