🤖較早收集於 3h

COCONUT 潛在推理多為課程訓練所致

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#latent-reasoning#curriculum-training#ood-generalizationcoconutmetacoconutgpt-2prosqa

💡揭穿 COCONUT 主張:課程 > 回收,損害 OOD(程式碼公開)(48字)

⚡ 30-Second TL;DR

有什麼變化

在 ProsQA 上訓練 GPT-2 124M 控制模型:M2 (COCONUT) 97.0%,M3 (固定嵌入) 96.6%,p=0.845

為什麼重要

削弱潛在空間推理主張,強調課程訓練在高 ProsQA 分數中的作用。揭示回收狀態風險,如過度自信與差異外推。鼓勵推理研究進行嚴格控制。

下一步行動

使用 GitHub 程式碼在 ProsQA 上以 GPT-2 複製實驗。

誰應關注:Researchers & Academics

關鍵要點

  • 在 ProsQA 上訓練 GPT-2 124M 控制模型:M2 (COCONUT) 97.0%,M3 (固定嵌入) 96.6%,p=0.845
  • 回收狀態損害 7-hop OOD:M4 勝 M2 10.9pp (p<0.001)
  • 多輪處理提升 DAG 泛化:M4 勝 M3 7.9pp
  • COCONUT 在 M4 更準的 OOD 任務上過度自信

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • COCONUT 論文於 2024 年 12 月發布於 arXiv,提出 Chain of Continuous Thought 範式,讓 LLM 在連續隱藏狀態中進行推理,而非解碼成語言 token[6]
  • COCONUT 在 ProsQA 資料集上達到 96.6% 準確率,使用僅 3 個 latent token 即可接近完美表現,遠超傳統 CoT 的 76.7%[4]
  • 訓練過程分階段:初期使用語言步驟,後期以最終隱藏狀態替換,每步 latent token 數由超參數 c 控制,從 1 遞增以提升容量[4]
  • 獨立重現顯示 COCONUT 雖 token 高效,但計算效率低,前訓練成本隨思考 token 指數上升,且適應新輸入格式需長時間[3]

🛠️ 技術深入

  • COCONUT 使用 LLM 最後隱藏狀態作為「continuous thought」,直接餵入下一輸入嵌入,避免解碼成詞彙 token[1][2][6]
  • 推理模式支援 BFS 策略,連續思想可同時編碼多條替代推理路徑,提升規劃與回溯任務表現[1][2]
  • 訓練分多階段課程:先語言模式,後以 c 個 latent token 表示每步(c 從 1 遞增),ground truth 為下一語言步驟[4]
  • 推論時模型自主決定終止 latent 推理,或填充至固定長度,減少 token 生成以提升效率[2]
  • ProsQA 資料集專為測試 DAG 規劃與回溯設計,驗證 COCONUT 在複雜推理任務優勢[1][4]

🔮 前景展望AI analysis grounded in cited sources

COCONUT 不會成為 2026 年 SOTA 推理模型主流
Manifold 市場於 2026 年 1 月以 NO 解決,儘管 COCONUT 引入 latent 空間推理,但重現顯示其計算效率低限制採用[3]
Latent 推理將推動後語言範式研究
COCONUT 與 Meta LCM/BLT 等架構共同探索連續空間,Yann LeCun 視為下一代 AI 藍圖,解鎖更高抽象推理[5]

時間線

2024-12
COCONUT 論文發布於 arXiv,介紹 Chain of Continuous Thought 範式
2025-01
Synced Review 報導 Meta 新架構包括 COCONUT,與 LCM/BLT 並列
2026-01
Manifold 市場因 COCONUT 論文解決 NO,未成 SOTA 推理模型
2026-03
Reddit r/MachineLearning 討論 COCONUT 控制實驗,公開程式碼與資料
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。