🍎較早收集於 19h

Goldilocks RL:調整任務難度提升LLM推理

Goldilocks RL:調整任務難度提升LLM推理
PostLinkedIn
🍎閱讀原文: Apple Machine Learning
#curriculum-learning#llm-reasoninggoldilocks-rlapplegoldilocks-rl

💡Apple 適應性 RL 解決 LLM 稀疏獎勵—高效推理訓練關鍵 (28字元)

⚡ 30-Second TL;DR

有什麼變化

教師模型預測學生 LLM 的每個問題難度

為什麼重要

此創新可大幅降低 LLM RLHF 的運算成本,使進階推理訓練更易取得。它從手動課程轉向適應性、模型專屬策略,有望加速代理式 AI 系統進展。

下一步行動

在你的 RLHF 設定中實驗教師-學生難度預測,用於推理任務。

誰應關注:Researchers & Academics

關鍵要點

  • 教師模型預測學生 LLM 的每個問題難度
  • 動態調整任務難度以擺脫 RL 中的稀疏獎勵
  • 相較經典課程學習,提升推理任務的樣本效率
  • 針對強化學習解鎖 LLM 推理能力

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Goldilocks RL 透過動態梯度範數最佳化實現更高效的參數更新,相比基線方法維持顯著更大的梯度範數,防止優化停滯並加速學習過程[1]
  • 該方法在 OpenMathReasoning 驗證集上展示更陡峭的學習曲線,在所有設定中均優於 GRPO 基線,驗證了理論預測的 √p_q(1-p_q) 與梯度範數的線性關係[1]
  • Apple 在 2026 年推出 Core AI 框架以取代 Core ML,標誌著蘋果戰略重點從傳統機器學習轉向生成式 AI 和推理能力,Goldilocks RL 代表此轉變的技術實踐[2]
  • Goldilocks RL 的樣本效率改進直接解決了強化學習在推理任務中的計算效率挑戰,與 Khatri 等人關於縮放為性能基本驅動力的研究相呼應[1]

🛠️ 技術深入

  • 梯度累積動態調整:根據模型大小和可用設備動態調整梯度累積步數,保持固定全局批次大小 288[1]
  • 獎勵方差最佳化:Goldilocks 維持一致更高的獎勵標準差,顯著降低零方差問題的比例(即 p_q(1-p_q)=0 導致零梯度的情況),確保優化器不浪費計算資源於無學習信號的樣本[1]
  • 效用評分機制:採用 √p_q(1-p_q) 作為效用評分,其中 p_q 代表問題 q 的成功概率,該評分與梯度範數維持線性關係[1]
  • 主動樣本選擇:優先選擇高不確定性樣本,改善優化景觀並提升每計算步驟的參數更新效率[1]

🔮 前景展望AI analysis grounded in cited sources

推理型 LLM 的計算效率將成為 2026 年後 AI 競爭的關鍵差異化因素
Goldilocks RL 透過樣本效率改進直接降低訓練成本,在 AI 模型規模持續擴大的背景下,效率優勢將轉化為商業競爭力[1]
Apple 的 Core AI 框架將推動第三方 AI 模型在設備端的整合標準化
Core AI 旨在促進第三方 AI 模型的集成,Goldilocks RL 等高效推理方法將成為設備端 AI 部署的基礎技術[2]
稀疏獎勵問題的解決將擴展強化學習在複雜推理任務中的應用範圍
Goldilocks RL 透過動態難度調整有效解決 RL 訓練中的梯度信號問題,為更廣泛的推理任務應用奠定基礎[1]

時間線

2025-11
Apple 2026 AIML 駐地計畫開放申請,支持跨學科 AI 研究與開發[4]
2025-06
WWDC 2025 宣布 Core ML 更新,引入更詳細的權重壓縮方法以優化生成式 AI 模型在設備端的運行[2]
2026-02
Goldilocks RL 研究論文發表於 arXiv(arXiv:2602.14868),由 Apple 研究科學家 Aryo Lotfi 等人共同撰寫[5]
2026-03
Apple 計畫於 WWDC 2026 推出 Core AI 框架,標誌從 Core ML 向生成式 AI 框架的戰略轉變[2]
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Apple Machine Learning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。