📄ArXiv AI•較早收集於 9h
LLM後訓練:能力引發 vs 創造

#free-energy#sft-rlllmsarxiv
💡新框架檢驗後訓練是否引發或創造LLM能力。(24字)
⚡ 30-Second TL;DR
有什麼變化
引入「可及支持」:有限計算預算下可及行為。
為什麼重要
釐清SFT vs RL辯論,讓人更好評估真正能力提升。引導選擇後訓練方法,用於真正擴展而非僅優化。
下一步行動
閱讀arXiv:2605.08368,並在下次SFT/RL實驗中測試可及支持。
誰應關注:Researchers & Academics
關鍵要點
- •引入「可及支持」:有限計算預算下可及行為。
- •引發:在支持內重新加權;創造:改變支持本身。
- •SFT/RL皆重新加權預訓練分佈,使用示範/獎勵訊號。
- •接近基模型的局部後訓練主要為引發,非創造。
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •該研究指出,後訓練(Post-training)的本質限制在於預訓練階段所建立的隱含知識邊界,這意味著若無外部工具介入,模型難以突破預訓練分佈的「支持集」(Support Set)。
- •自由能框架(Free Energy Framework)被用於量化模型在後訓練過程中的行為變化,揭示了監督式微調(SFT)與強化學習(RL)在優化目標上的數學等價性,即皆為對分佈的條件性重加權。
- •研究強調了「推理時計算」(Inference-time compute)作為擴展模型能力的新途徑,透過搜尋與工具使用,模型能動態擴展其行為空間,而非僅依賴後訓練階段的參數更新。
🛠️ 技術深入
- •模型行為空間定義:將模型行為視為機率分佈 P(y|x),後訓練過程被建模為在預訓練分佈 P_pre(y|x) 基礎上,透過 KL 散度約束進行的分佈偏移。
- •能力引發(Elicitation)機制:透過 SFT 損失函數 L = -log P(y|x) 或 RL 獎勵函數 R(y),在預訓練分佈的非零機率區域內進行機率質量重分配。
- •能力創造(Creation)機制:涉及引入外部知識庫、工具調用 API 或蒙地卡羅樹搜尋(MCTS)等機制,實質上改變了模型在推理時的條件分佈 P(y|x, tools, search_path)。
- •自由能最小化:後訓練過程被視為最小化變分自由能 F = E[log P(y|x)] + KL(P||P_pre),其中 KL 項限制了模型對預訓練知識的偏離程度。
🔮 前景展望AI analysis grounded in cited sources
後訓練技術將從參數優化轉向推理時計算架構的整合。
由於參數微調難以創造新能力,未來模型將更依賴於推理時的搜尋與工具使用來突破預訓練的邊界。
評估基準將從靜態問答轉向動態問題解決能力。
隨著研究區分引發與創造,現有的靜態基準測試將無法有效衡量模型在未知領域的創造性推理能力。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。