🤖較早收集於 44m

FeynRL:用於強化學習後訓練的開源框架

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#rlhf#llm-training#open-sourcefeynrlfeynrlvllmdpo

💡厭倦了黑盒強化學習訓練?FeynRL 為 LLM 後訓練提供了一個明確且可修改的框架。

⚡ 30-Second TL;DR

有什麼變化

為 LLM 和 VLM 的強化學習後訓練提供明確的端到端訓練循環。

為什麼重要

透過公開完整的訓練循環,FeynRL 降低了研究人員嘗試新穎強化學習演算法的門檻,有望加速模型對齊和代理行為的進展。

下一步行動

複製 FeynRL 儲存庫並在您自己的資料集上測試 DPO 範例,以評估它是否能簡化您目前的後訓練工作流程。

誰應關注:Researchers & Academics

關鍵要點

  • 為 LLM 和 VLM 的強化學習後訓練提供明確的端到端訓練循環。
  • 支援 SFT、DPO 和強化學習風格的訓練,並具備多 GPU 和叢集擴展能力。
  • 旨在讓研究人員能夠修改 rollout 策略和獎勵設計,而無需處理隱藏的系統抽象。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • FeynRL 採用「演算法優先」的設計理念,將演算法邏輯與系統邏輯明確分離,旨在讓研究人員能夠輕鬆實作、調試和修改新的後訓練演算法,而無需深入處理底層基礎設施的複雜性。
  • 該框架支援多種強化學習演算法,包括PPO、GRPO、CISPO和P3O,以及監督式微調(SFT)和偏好學習(如DPO),為研究人員提供了廣泛的實驗選擇。
  • FeynRL從設計之初就考慮到大規模訓練的需求,整合了DeepSpeed、Ray和vLLM等技術,支援同步和非同步執行模式、自適應權重同步以及多節點運行,使其能夠在單一GPU到大型叢集環境中進行高效訓練。
  • 該框架包含許多實用的強化學習後訓練技巧和想法,這些通常分散在論文、程式碼庫或非正式交流中,旨在顯著提高訓練的穩定性和可靠性。
  • FeynRL的程式碼庫結構清晰,將演算法(algs/)、rollout生成(rollouts/)、獎勵函數(rewards/)等核心組件模組化,便於理解、測試和擴展。
📊 競品分析▸ Show
特性/框架FeynRLOpenRLHFTRL (Transformer Reinforcement Learning)DeepSpeed-Chat
設計理念演算法優先,強調清晰度、局部修改和演算法開發,系統邏輯明確。易用、可擴展、高性能,統一的基於代理的設計範式,專注於70B+模型的RLHF擴展。整合Hugging Face生態系統,提供開箱即用的RLHF解決方案,但可能難以修改。專注於大規模RLHF訓練的效率和擴展性,但可能難以修改。
支援演算法SFT, DPO, PPO, GRPO, CISPO, P3O。RLHF, DPO, KTO, LoRA, 拒絕採樣, REINFORCE++, GRPO, RLOO。RLHF, DPO, PPO等。RLHF, PPO等。
擴展性/分散式訓練DeepSpeed, Ray, vLLM (同步/非同步執行, 多GPU/叢集, 自適應權重同步)。Ray, vLLM, DeepSpeed (針對70B+模型重新設計排程,跨GPU分配模型,支援非同步資料流和遠端引擎互動)。通常在單一GPU上共置四個模型,或使用LoRA減少記憶體,可能在大型模型上效率低下。通常在單一GPU上共置四個模型,使用ZeRO等技術,可能在大型模型上效率低下。
VLM支援支援VLM的強化學習後訓練。支援多輪VLM RL,處理圖像輸入和環境回饋。未明確提及VLM的端到端RL訓練。未明確提及VLM的端到端RL訓練。
易修改性演算法邏輯局部化,易於修改和開發新方法,無需重塑整個堆疊。簡化的設計和清晰的程式碼結構,易於研究人員和實踐者入門。針對特定工作流程優化,修改新方法可能較困難。針對特定工作流程優化,修改新方法可能較困難。

🛠️ 技術深入

  • 設計哲學:採用「演算法優先」的設計,強調演算法邏輯的局部性,使演算法更改易於實作和推理,而分散式系統層則保持明確而非隱藏在抽象之後。
  • 分散式訓練整合:利用DeepSpeed作為訓練工作者,Ray用於整個訓練循環的協調和排程,vLLM則作為rollout生成工作者,支援跨節點的資源分配。
  • 執行模式:提供同步(on-policy)模式,每個epoch生成所有rollout後進行訓練;以及非同步(overlap或async)模式,rollout生成和訓練在獨立的GPU池上並行運行,以提高效率。
  • 支援演算法:在強化學習方面,支援PPO、GRPO、CISPO、P3O等演算法;在偏好學習方面,支援DPO;同時也支援監督式微調(SFT)。
  • 模組化組件:程式碼庫結構清晰,包括algs/(演算法和優化邏輯)、rollouts/(rollout生成、vLLM引擎封裝、權重同步和重播緩衝區)、rewards/(可插拔的獎勵函數,如GSM8K、數學驗證等)、data_feeds/(資料載入和採樣)、data_prep/(資料準備腳本)和configs/(YAML配置)。
  • 擴展性功能:支援自適應權重同步和多節點運行,旨在實現從單一GPU調試到大規模分散式運行的無縫過渡。

🔮 前景展望AI analysis grounded in cited sources

FeynRL將加速強化學習演算法的創新與實驗。
其「演算法優先」的設計和清晰的程式碼結構,降低了研究人員修改和開發新後訓練方法的門檻。
FeynRL的模組化設計將促進社群協作與新方法的快速整合。
透過明確的關注點分離和對社群貢獻的開放態度,FeynRL有望成為強化學習後訓練領域的協作基礎。
FeynRL對大規模訓練的支援將推動LLM和VLM在實際應用中的效能提升。
框架與DeepSpeed、Ray和vLLM的整合,使其能夠在多GPU和叢集環境中進行高效訓練,從而實現更強大的模型。

時間線

2026-06
FeynRL 作為開源框架公開預覽並正式宣布發布。

📎 來源 (6)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. github.com
  2. reddit.com
  3. medium.com
  4. arxiv.org
  5. github.com
  6. aclanthology.org
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。