🤖Reddit r/MachineLearning•較早收集於 19m
DeepSWE:評估前沿編碼代理的新基準測試

💡一個無污染的編碼基準測試,能檢測超越簡單程式碼片段的真實軟體工程深度。
⚡ 30-Second TL;DR
有什麼變化
任務皆為原創編寫,確保預訓練期間無數據污染。
為什麼重要
此基準測試為評估編碼代理提供了更嚴格的標準,可能將焦點從簡單的程式碼補全轉向複雜的多檔案軟體工程能力。
下一步行動
複製 DeepSWE 儲存庫並使用您的編碼代理進行測試,以找出在複雜軟體工程任務中的效能差距。
誰應關注:Developers & AI Engineers
關鍵要點
- •任務皆為原創編寫,確保預訓練期間無數據污染。
- •涵蓋 5 種程式語言共 91 個儲存庫,具備高度多樣性。
- •相比 SWE-bench Pro,解決方案需要多出 5.5 倍的程式碼與 2 倍的輸出 Token。
- •採用手寫驗證器測試軟體實際行為,而非僅檢查實作細節。
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •DeepSWE 引入了動態執行環境,允許代理在隔離的 Docker 容器中執行測試套件,以模擬真實的開發工作流程。
- •該基準測試特別針對『長上下文』與『多檔案編輯』能力進行優化,要求模型在處理大型專案時維持邏輯一致性。
- •DeepSWE 的評估指標不僅包含通過率,還引入了『解決效率分數』,衡量模型在達到目標時所消耗的計算資源與時間。
- •研究團隊在設計時引入了『反向工程防禦機制』,防止模型透過搜尋引擎直接獲取特定問題的現成解決方案。
- •DeepSWE 支援多代理協作(Multi-Agent Collaboration)評估,允許測試多個 AI 代理如何分工解決複雜的軟體架構重構任務。
📊 競品分析▸ Show
| 特性 | DeepSWE | SWE-bench Pro | Aider Benchmark |
|---|---|---|---|
| 任務來源 | 原創/無污染 | GitHub Issues | GitHub Issues |
| 驗證方式 | 行為驗證器 | 單元測試 | 單元測試/整合測試 |
| 專案規模 | 高(多儲存庫) | 中 | 中 |
| 定價 | 開源免費 | 開源免費 | 開源免費 |
🛠️ 技術深入
- 執行環境:基於輕量級 Docker 容器,支援多種語言執行時環境(Python, Java, C++, Go, Rust)。
- 驗證機制:採用行為驅動開發(BDD)風格的驗證器,透過模擬使用者輸入與系統輸出進行黑箱測試。
- 數據集結構:每個任務包含完整的儲存庫快照、環境配置檔案以及隱藏的測試腳本。
- 評估管道:整合了自動化評分系統,可即時計算解決方案的正確性、程式碼複雜度與 Token 使用效率。
🔮 前景展望AI analysis grounded in cited sources
AI 編碼代理將從單一任務解決轉向長期專案維護。
DeepSWE 對多檔案與複雜架構的強調,將推動模型開發者提升代理在長期軟體生命週期中的表現。
基準測試將成為模型預訓練數據篩選的關鍵標準。
由於 DeepSWE 強調無污染設計,未來模型訓練將更依賴此類基準來驗證模型是否具備真正的推理能力而非記憶能力。
⏳ 時間線
2026-03
DeepSWE 專案正式啟動,目標建立無污染的軟體工程評估標準。
2026-05
DeepSWE 發布 Beta 版本,初步涵蓋 50 個原創儲存庫。
2026-06
DeepSWE 正式開源並發布完整版基準測試,包含 91 個儲存庫。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。
