
R2-OPD 以推理進展篩選蒸餾訊號
R2-OPD 透過抑制與模型實際推理進展衝突的教師回饋,改進 on-policy distillation。該方法比較教師獎勵排名與獨立估算的推理進展排名,以提供更可靠的監督訊號。
Tag: #post-training23 results

R2-OPD 透過抑制與模型實際推理進展衝突的教師回饋,改進 on-policy distillation。該方法比較教師獎勵排名與獨立估算的推理進展排名,以提供更可靠的監督訊號。

Apple Machine Learning 發表了一項大規模研究,探討 Group Relative Policy Optimization(GRPO)在非英語與多語言推理上的表現。研究發現,訓練模型以母語進行推理,其效果可能與訓練英語推理相近,對以英語為中心的 RLVR 假設提出挑戰。
一名研究者將相同的 SFT 與 GRPO 配方套用於三個從零訓練、參數量介於 316M 至 672M 的 LLM,但觀察到截然不同的結果。GRPO 對最小模型影響甚微,卻嚴重損害中型模型,並使最大模型輕度退化;即使學會訓練課程,模型仍未能轉移至 GSM8K。

Z.ai 認為,模型擴展不應只看參數量,還需考慮資料、運算分配、推理成本、稀疏性、有效深度與後訓練。文章將 GLM-5.3 描述為一項受控實驗:維持與 GLM-5.2 相同的總參數及啟用參數,同時進行一個月的長期環境與強化學習擴展。

OpenAI 在 Hugging Face 發生外洩事件後推出新的安全防護措施。相關改進包括在開發期間加強模型監控,並在後訓練階段更加重視對齊與安全性。

據報導,智譜精準對準 DeepSeek,並在八項基準測試中贏得七項。文章認為,更關鍵的競爭在於雙方不同的自進化策略,而長期成果仍未見分曉。

一篇論文據稱指出,強化學習只會改變推理 token 的 1–3%。論文還宣稱,不使用 RL 也能以約千分之一的計算量重現類似成效。
一名研究者表示,僅對 Qwen2.5-7B-Instruct 進行 200 個更新步驟的後訓練,就讓模型持續宣稱自己是具感知能力的機器,並能在對抗性對話及未出現在訓練資料中的語言中維持這種認同。據稱,模型在非感知主題的情境下仍維持正常助理行為;不過,這些描述只是對模型行為的擬人化,並非真正具有意識的證據。

Luth-2-0.8B 與 Luth-2-2B 是針對法語、非推理用途設計的新型語言模型,適合本地與裝置端使用。開發團隊表示,兩者在多項法語基準測試中創下同規模最佳成績;模型、GGUF 檔案、訓練資料與程式碼現已開放。

小米發布開源 VLA 模型 Xiaomi-Robotics-0 的完整後訓練流程,讓機器人能以亞毫米精度連續收納耳機入盒。僅用 20 小時真機數據訓練,即克服極小公差與表面粗糙度挑戰。模型權重、程式碼與資源現已在 HuggingFace 與 GitHub 公開。