🦙Reddit r/LocalLLaMA•較早收集於 70m
SWE-rebench-V2:最大開放程式碼資料集

💡最大開放多語言程式碼資料集,提升程式碼代理 RL 訓練—對排行榜至關重要。
⚡ 30-Second TL;DR
有什麼變化
32,000+ 個基於真實問題的可執行任務,附 Docker 環境
為什麼重要
此資料集實現多語言程式碼代理的大規模 RL 訓練,可能加速開源程式碼 AI 的進展,超越 Python 中心基準。降低研究人員訓練競爭模型的門檻。
下一步行動
從 Hugging Face 下載 SWE-rebench-V2,並在其 32k 任務上微調您的程式碼代理。
誰應關注:Researchers & Academics
關鍵要點
- •32,000+ 個基於真實問題的可執行任務,附 Docker 環境
- •支援 20 種程式語言,包括 Lua 和 Clojure
- •來自真實拉取請求的 120,000+ 額外任務
- •透過 LLM 集成過濾高品質,並測試可解性
- •附技術報告和 Discord 排行榜
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •SWE-rebench V2 涵蓋 2014–2025 年任務,中位數任務修改 3 個檔案與 34 行程式碼,但 90% 分位數達 9 個檔案與 181 行,呈現長尾分佈。[1]
- •資料集語言分佈以 Python (21.6%) 與 Go (20.6%) 為主,其次為 JS/TS/Rust,來自 3,600+ 儲存庫。[1]
- •排行榜顯示 Claude Opus 4.6 位居第一,DeepSeek v3.2 在開源模型中達 SOTA,但 token 消耗最高。[3]
- •相較 SWE-Bench Verified,SWE-rebench 因時間新穎性導致模型表現大幅下降,如 DeepSeek-V3-0324 從 39.7% 降至 21.3%。[2]
📊 競品分析▸ Show
| 特徵 | SWE-rebench V2 | SWE-bench |
|---|---|---|
| 任務數量 | 32,000+ (20 語言) | 2,294 (Full), 500 (Verified) |
| 語言支援 | 20 種 (Python 21.6%, Go 20.6%) | 主要 Python,多語言子集 9 種 |
| 資料新穎性 | 2014–2025,抗汙染 | Verified 子集易汙染 |
| 基準表現 | Claude Opus 4.6 #1 (低 SEM) | Claude 4.5 Sonnet 71.40% (Verified) |
| 其他 | Docker 預建映像,持續擴展 | Lite/Multimodal 子集 |
🛠️ 技術深入
🔮 前景展望AI analysis grounded in cited sources
SWE-rebench V2 將加速多語言程式碼代理訓練
其 20 語言規模與 Docker 環境提供真實 SWE 互動資料,超越單一語言限制並支援 RL 訓練。
基準將暴露 LLM 汙染問題並提升評估可靠性
時間新穎任務導致模型表現下降 18%以上,證明靜態基準高估能力。
開源模型如 DeepSeek v3.2 將縮小與封閉模型差距
排行榜顯示其在開源中達 SOTA,儘管 token 消耗高但表現穩定。
⏳ 時間線
2024-06
SWE-bench Docker 化,奠定評估基礎
2024-03
SWE-agent 發布 (12.47% on SWE-bench),啟發代理基準
2025-05
SWE-smith 發布,用於 SWE 代理模型訓練
2025-07
mini-SWE-agent 達 65% on Verified,推动簡化代理
2025-09
SWE-rebench V1 論文發表 (NeurIPS),21K Python 任務
2026-02
SWE-rebench V2 發布,擴至 32K 任務與 20 語言
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。

