Search

Tag: #llm-training33 results

🤖

深入解析用於 LLM 訓練的 RL 與 OPD

一部影片教學解析大型語言模型訓練中 on-policy distillation(OPD)與 GRPO 類強化學習方法背後的數學與程式碼。內容也將這些技術與預訓練及監督式微調串聯,並參考 Kimi、DeepSeek、Qwen 與 GLM 技術報告中的方法。

Reddit r/MachineLearningCommunityAug 3#post-training#llm-training
Page 3 of 4