🦙較早收集於 70m

SWE-rebench-V2:最大開放程式碼資料集

SWE-rebench-V2:最大開放程式碼資料集
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡最大開放多語言程式碼資料集,提升程式碼代理 RL 訓練—對排行榜至關重要。

⚡ 30-Second TL;DR

有什麼變化

32,000+ 個基於真實問題的可執行任務,附 Docker 環境

為什麼重要

此資料集實現多語言程式碼代理的大規模 RL 訓練,可能加速開源程式碼 AI 的進展,超越 Python 中心基準。降低研究人員訓練競爭模型的門檻。

下一步行動

從 Hugging Face 下載 SWE-rebench-V2,並在其 32k 任務上微調您的程式碼代理。

誰應關注:Researchers & Academics

關鍵要點

  • 32,000+ 個基於真實問題的可執行任務,附 Docker 環境
  • 支援 20 種程式語言,包括 Lua 和 Clojure
  • 來自真實拉取請求的 120,000+ 額外任務
  • 透過 LLM 集成過濾高品質,並測試可解性
  • 附技術報告和 Discord 排行榜

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • SWE-rebench V2 涵蓋 2014–2025 年任務,中位數任務修改 3 個檔案與 34 行程式碼,但 90% 分位數達 9 個檔案與 181 行,呈現長尾分佈。[1]
  • 資料集語言分佈以 Python (21.6%) 與 Go (20.6%) 為主,其次為 JS/TS/Rust,來自 3,600+ 儲存庫。[1]
  • 排行榜顯示 Claude Opus 4.6 位居第一,DeepSeek v3.2 在開源模型中達 SOTA,但 token 消耗最高。[3]
  • 相較 SWE-Bench Verified,SWE-rebench 因時間新穎性導致模型表現大幅下降,如 DeepSeek-V3-0324 從 39.7% 降至 21.3%。[2]
📊 競品分析▸ Show
特徵SWE-rebench V2SWE-bench
任務數量32,000+ (20 語言)2,294 (Full), 500 (Verified)
語言支援20 種 (Python 21.6%, Go 20.6%)主要 Python,多語言子集 9 種
資料新穎性2014–2025,抗汙染Verified 子集易汙染
基準表現Claude Opus 4.6 #1 (低 SEM)Claude 4.5 Sonnet 71.40% (Verified)
其他Docker 預建映像,持續擴展Lite/Multimodal 子集

🛠️ 技術深入

  • 自動化管道篩選階段:從 29.5M PRs 過濾至 32,079 任務,成功率經 F2P (Fix-to-Pass) 驗證,涵蓋 3,617 儲存庫。[1]
  • 任務統計:中位數修改 3 檔案/34 行,平均難度中等,重尾分佈 (p95: 多檔案/長行),附預建 Docker 映像支援執行。[1]
  • 未來擴展計劃:增加設定重試率、精選子集、長尾語言支援,以及複雜多服務任務與非功能性獎勵 (效能/延遲)。[1]

🔮 前景展望AI analysis grounded in cited sources

SWE-rebench V2 將加速多語言程式碼代理訓練
其 20 語言規模與 Docker 環境提供真實 SWE 互動資料,超越單一語言限制並支援 RL 訓練。
基準將暴露 LLM 汙染問題並提升評估可靠性
時間新穎任務導致模型表現下降 18%以上,證明靜態基準高估能力。
開源模型如 DeepSeek v3.2 將縮小與封閉模型差距
排行榜顯示其在開源中達 SOTA,儘管 token 消耗高但表現穩定。

時間線

2024-06
SWE-bench Docker 化,奠定評估基礎
2024-03
SWE-agent 發布 (12.47% on SWE-bench),啟發代理基準
2025-05
SWE-smith 發布,用於 SWE 代理模型訓練
2025-07
mini-SWE-agent 達 65% on Verified,推动簡化代理
2025-09
SWE-rebench V1 論文發表 (NeurIPS),21K Python 任務
2026-02
SWE-rebench V2 發布,擴至 32K 任務與 20 語言

📎 來源 (6)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. arXiv — 2602
  2. emergentmind.com — Swe Rebench Dataset
  3. swe-rebench.com
  4. openreview.net — Forum
  5. arXiv — 2602
  6. swebench.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。