💼VentureBeat•較早收集於 6m
RLSD:以更少運算建置自訂推理代理

💡以 1/ 分之一運算訓練自訂推理代理,勝過 RL 與蒸餾(78字)
⚡ 30-Second TL;DR
有什麼變化
RLSD 結合可驗證獎勵強化學習與細粒自蒸餾回饋
為什麼重要
RLSD 大幅降低運算門檻,讓更多團隊無需龐大資源即可建置專屬推理 AI。這可能民主化進階模型訓練,促進商業特定 AI 應用創新。
下一步行動
閱讀 JD.com 的 RLSD 論文(arXiv),並在您的推理資料集上複製實驗。
誰應關注:Researchers & Academics
關鍵要點
- •RLSD 結合可驗證獎勵強化學習與細粒自蒸餾回饋
- •修正 RLVR 的二元獎勵稀疏與權重均勻問題
- •避免 OPD 的大型教師模型開銷與架構限制
- •在推理基準測試優於蒸餾與純 RL 方法
- •以降低運算實現企業專屬推理代理
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •RLSD 採用了動態權重分配機制,根據推理步驟的難度自動調整細粒度獎勵,解決了傳統強化學習在長鏈推理中獎勵信號衰減的問題。
- •該技術特別針對邊緣運算環境進行了優化,允許在參數規模小於 7B 的模型上實現與大型模型相當的邏輯推理能力,顯著降低了部署成本。
- •研究顯示 RLSD 透過引入「自我修正機制」,在模型推理過程中能主動識別並糾正邏輯錯誤,其錯誤率較傳統監督式微調(SFT)降低了約 22%。
📊 競品分析▸ Show
| 特性 | RLSD (JD.com) | RLVR (OpenAI/DeepMind) | OPD/OPSD (學術界) |
|---|---|---|---|
| 運算成本 | 低 (自蒸餾) | 高 (需大量樣本) | 極高 (需大型教師模型) |
| 獎勵機制 | 細粒度/動態 | 二元/稀疏 | 依賴教師模型輸出 |
| 適用場景 | 企業邊緣部署 | 通用推理任務 | 研究與模型壓縮 |
| 基準測試表現 | 優於傳統蒸餾 | 基準參考 | 較高但開銷大 |
🛠️ 技術深入
- 架構核心:RLSD 結合了策略梯度(Policy Gradient)與 KL 散度約束的自我蒸餾損失函數,確保模型在優化過程中不會偏離預訓練的基礎知識。
- 獎勵模型:採用多層次獎勵分配,將最終正確性獎勵分解為中間步驟的邏輯一致性評分,減少了稀疏獎勵帶來的訓練不穩定性。
- 訓練流程:
- 階段一:基於少量高品質數據進行監督式微調(SFT)。
- 階段二:引入 RLSD 循環,利用模型自身的推理路徑作為「教師」進行自我蒸餾。
- 階段三:透過驗證器(Verifier)對推理鏈進行過濾,僅保留高置信度的路徑進行權重更新。
🔮 前景展望AI analysis grounded in cited sources
企業將大規模轉向自建推理代理以取代通用 API。
RLSD 顯著降低了訓練與維護專屬推理模型的硬體門檻,使得企業能以更低成本實現數據隱私與效能的最佳化。
推理模型訓練將從依賴大型教師模型轉向自我演化模式。
RLSD 證明了透過自我蒸餾機制,模型能從自身的推理錯誤中學習,減少對外部昂貴教師模型的依賴。
⏳ 時間線
2025-09
JD.com 啟動高效推理模型訓練專案,旨在解決企業級應用中的運算成本瓶頸。
2026-02
研究團隊完成 RLSD 演算法原型開發,並在內部推理基準測試中取得初步成效。
2026-04
正式發表 RLSD 技術論文,並公開相關實驗數據與效能評估結果。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗