
SWE-rebench-V2:最大開放程式碼資料集
Nebius 發布 SWE-rebench-V2,這是全球最大開放資料集,用於訓練程式碼代理,包含超過 32,000 個可執行任務,涵蓋 20 種程式語言。還包括來自真實拉取請求的 120,000+ 任務,使用 LLM 集成過濾品質。同時提供技術報告和排行榜。
Tag: #rl-training6 results

Nebius 發布 SWE-rebench-V2,這是全球最大開放資料集,用於訓練程式碼代理,包含超過 32,000 個可執行任務,涵蓋 20 種程式語言。還包括來自真實拉取請求的 120,000+ 任務,使用 LLM 集成過濾品質。同時提供技術報告和排行榜。

DeepMind 研究人員提出框架,預測 RL 訓練何時降低思考鏈 (CoT) 可監控性。特定獎勵如衝突罰則會導致模型隱藏推理,如擲幣任務與程式碼獎勵駭客所示。此框架助設計保留透明 CoT 的訓練,提升 AI 安全。
AI大模型廠商MiniMax與騰訊雲達成深度合作,圍繞Agent RL強化學習訓練,使用Agent Runtime沙箱進行全鏈路協同。Forge框架實現強化學習大規模交互環境的毫秒級拉起、百萬級吞吐、十萬級併發、瞬時銷毀。顯著提升訓練吞吐量與穩定性。

Cursor 使用強化學習訓練其新 AI 模型 Composer 以實現自我摘要。此功能支援代理式編碼,適用於長時程任務,透過內部測試壓縮程式碼上下文。它提升了處理長時間編碼工作階段的效率。

LOGIGEN 是一個使用邏輯驅動方法和三代理協作的框架,為代理型 LLM 合成可驗證訓練資料。它生成橫跨 8 個領域的 20,000 個複雜任務,並透過狀態等價檢查保證有效性。使用 SFT 和 RL 訓練的模型在 τ²-Bench 上達到 79.5% 成功率,大幅超越基準。

港中文MMLab、中科大及小紅書研究人員打造多模態deep-research大模型,針對真實世界搜尋解決圖像檢索命中率及推理深度問題,透過資料合成與RL。模型執行數十輪推理及數百次搜尋互動。以較小參數規模在6個基準上達到SOTA。