📄較早收集於 20h

潛在推理在弱監督與強監督下的表現

潛在推理在弱監督與強監督下的表現
PostLinkedIn
📄閱讀原文: ArXiv AI
#latent-space#shortcut-behavior#supervision-tradeofflatent-reasoningarxiv

💡揭露潛在推理捷徑與監督權衡,為穩健 AI 至關重要(24字)

⚡ 30-Second TL;DR

有什麼變化

普遍捷徑行為在無真正潛在推理下即達高準確率

為什麼重要

揭示潛在推理範式的限制,引導更可靠 AI 推理的訓練策略。幫助從業人員避免過度依賴監督而不了解內部行為。

下一步行動

下載 arXiv:2602.22441v1 並測試您潛在推理模型中的捷徑行為。

誰應關注:Researchers & Academics

關鍵要點

  • 普遍捷徑行為在無真正潛在推理下即達高準確率
  • 潛在表示可編碼多種可能性,但推理呈現隱式修剪
  • 權衡:強監督減輕捷徑但壓縮多樣假設

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • 弱監督可透過W2SR範式,從小模型(如1.5B/7B)生成的長CoT軌跡訓練強模型,恢復近94% RL效能,成本遠低於強化學習[1][2]
  • 弱到強泛化(WSG)在NLP任務上表現優異,強模型可超越弱監督者20%以上效能差距,甚至接近強監督上限[3][5]
  • 漸進弱到強推理框架加入偏好優化,讓強模型從弱監督錯誤中學習,在MATH level 4-5難題超越金標準微調[4]
  • 潛在推理評估面臨挑戰,難以區分真多步推理與捷徑,且模型泛化至新問題類型時易脆性[7]

🛠️ 技術深入

  • W2SR使用弱教師模型(1.5B/7B教7B/14B,7B/14B教32B)生成長CoT軌跡,透過監督微調強學生模型[1][2]
  • 引入信心損失避免強學生模仿弱監督錯誤,輔助損失減少弱標籤過擬合,提升泛化[3]
  • 層級蒸餾使用MSE及InfoNCE對比損失,對齊顯式CoT教師與潛在空間學生隱藏狀態[7]
  • 潛在CoT採用多樣性尋求強化學習,提供稀疏token級獎勵,並用貝氏邊際似然取代Best-of-N搜尋[6]

🔮 前景展望AI analysis grounded in cited sources

弱到強範式將取代昂貴RL,成為LLM推理訓練主流
W2SR以弱模型監督恢復94% RL效能,成本大幅降低且可擴展至長CoT任務[1][2]
潛在推理需新基準解決捷徑與真探索區分問題
現有評估難辨多步推理與啟發式,影響模型泛化可靠性[7]
漸進框架將使小模型在超智時代有效監督超大模型
偏好優化讓強模型從弱錯誤學習,超越金標準於高難任務[4]

時間線

2023-11
OpenAI發布弱到強泛化證明概念,展示NLP與棋局任務效能
2024-11
EMNLP發表漸進弱到強推理框架,引入偏好優化超越強上限
2025-05
arXiv發布W2SR範式,弱監督恢復94% RL推理效能
2025-11
NeurIPS展示潛在CoT視覺推理,引入多樣性RL與貝氏縮放
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。