💼VentureBeat•較早收集於 28m
DeepSWE 評測挑戰 AI 程式碼排行榜與 GPT-5.5 的領先地位

💡大型程式碼評測審計揭露 32% 錯誤率,並將 GPT-5.5 評為新一代領先者。
⚡ 30-Second TL;DR
有什麼變化
DeepSWE 評估了 113 項任務與 91 個儲存庫,顯示出比以往評測更顯著的效能差距。
為什麼重要
這一發現迫使企業採購團隊重新思考評估 AI 程式碼代理的方式,因為目前的指標可能不可靠。這凸顯了 AI 產業對更強大、無污染評估框架的迫切需求。
下一步行動
停止僅依賴 SWE-Bench Pro 分數;應納入內部的私有程式碼庫評估,以驗證模型是否符合您的特定工程需求。
誰應關注:Developers & AI Engineers
關鍵要點
- •DeepSWE 評估了 113 項任務與 91 個儲存庫,顯示出比以往評測更顯著的效能差距。
- •GPT-5.5 以 70% 的成功率脫穎而出,大幅領先競爭對手。
- •審計顯示 SWE-Bench Pro 的自動評分存在 32% 的錯誤率,暗示現有基準測試存在廣泛的不準確性。
- •該基準測試解決了 GitHub 抓取數據集中固有的數據污染與模型記憶問題。
🧠 深度解析
Web-grounded analysis with 18 cited sources.
🔑 增強重點摘要
- •DeepSWE 的任務比 SWE-Bench Pro 大幅增加,其參考解決方案平均為 668 行程式碼,而 SWE-Bench Pro 的單檔案變更平均為 120 行程式碼,這表明 DeepSWE 旨在評估更複雜、更耗時的軟體工程任務。
- •Datacurve 的審計發現,SWE-Bench Pro 的驗證器存在 8.5% 的誤報率(接受錯誤的實作)和 24% 的漏報率(拒絕正確的實作),而 DeepSWE 的驗證器則具有顯著較低的錯誤率(分別為 0.3% 和 1.1%),這質疑了現有基準測試的可靠性。
- •GPT-5.5 專為「代理式使用案例」進行了優化,即模型需要長時間依序執行多個動作的任務,並且在處理此類任務時比以前的模型快 2-3 倍,這突顯了其在自主軟體工程代理方面的潛力。
- •Datacurve 這家開發 DeepSWE 的公司成立於 2024 年,已籌集 1820 萬美元資金,其核心業務是為大型語言模型 (LLM) 提供精選的程式碼資料,並提供 AI 驅動的開發工具。
- •儘管 SWE-Bench Pro 存在局限性,但它最初的開發目的是為了解決早期基準測試中存在的資料污染、任務多樣性有限、問題過於簡化以及測試不可靠等挑戰,旨在提供更嚴謹的 AI 代理評估。
📊 競品分析▸ Show
| 特徵/基準 | DeepSWE | SWE-Bench Pro | SWE-Bench Verified | HumanEval | Terminal-Bench 2.0 |
|---|---|---|---|---|---|
| 任務數量 | 113 項任務 | 1865 項任務 | 約 500 項任務 (過濾後) | 164 項程式設計問題 | 測試真實命令列工作流程 |
| 儲存庫數量 | 91 個開源儲存庫 | 41 個專業儲存庫 (開源與私有) | 開源 Python 儲存庫 | 不適用 (函式級別) | 不適用 (代理式) |
| 任務複雜度 | 長週期軟體工程,平均 668 行程式碼 | 長週期軟體工程,旨在抵抗污染 | 函式級別,易受污染,許多有缺陷 | 函式級別,衡量功能正確性 | 規劃、迭代、工具協調 |
| 驗證器錯誤率 | 誤報 0.3%,漏報 1.1% | 誤報 8.5%,漏報 24% (Datacurve 審計) | 許多測試案例有缺陷 | 自動單元測試 | 不適用 |
| GPT-5.5 表現 | 70% 成功率 (領先) | 23.1% (公開集), 14.9% (私有集) | 不適用 (已飽和) | 高於 90% (飽和) | 82.7% (領先) |
| Claude Opus 表現 | 54% (約) | 22.7% (公開集), 17.8% (私有集) | 約 80% (飽和) | 不適用 | 69.4% |
| DeepSWE-Preview (Qwen3-32B) | 不適用 | 不適用 | 59.0% (開源模型第一) | 不適用 | 不適用 |
備註:價格資訊未在搜尋結果中明確提及,因此未包含在比較中。
🛠️ 技術深入
- DeepSWE 基準測試專注於「長週期軟體工程」任務,其任務規模遠大於傳統基準測試,參考解決方案平均包含 668 行程式碼,旨在更真實地反映實際開發挑戰。
- DeepSWE 的驗證器經過嚴格審計,誤報率僅為 0.3%,漏報率為 1.1%,這顯著優於 SWE-Bench Pro 的驗證器,後者分別為 8.5% 和 24%,確保了評估結果的更高準確性。
- DeepSWE-Preview 是一個開源程式碼代理,其訓練基於 Qwen3-32B 模型,並完全採用強化學習 (RL) 進行,特別是使用了一種修改後的「解耦優勢策略優化 (Decoupled Advantage Policy Optimization, DAPO)」演算法。
- DeepSWE 的訓練過程涉及使用來自 R2E-Gym 基準測試的 4,500 個真實世界軟體工程任務,並在 64 個 H100 GPU 上耗時六天完成。
- GPT-5.5 被描述為一種原生全模態模型,能夠在單一統一架構中處理文字、圖像、音訊和視訊,並且針對代理式使用案例進行了優化,顯著提升了多步驟推理和工具使用的可靠性。
- GPT-5.5 的 API 支援高達 100 萬個 token 的上下文視窗(在 Codex 中為 40 萬個),這對於處理大型程式碼庫和複雜的軟體工程任務至關重要。
🔮 前景展望AI analysis grounded in cited sources
AI 模型評估標準將加速轉向更複雜、更真實的軟體工程任務。
DeepSWE 揭示了現有基準測試的缺陷,特別是資料污染和任務規模不足,這將促使產業採用更嚴謹、更貼近實際開發的評估方法。
開源 AI 程式碼生成模型將面臨更大的挑戰,以追趕閉源頂尖模型的效能差距。
DeepSWE 的結果顯示 GPT-5.5 大幅領先,這表明閉源模型在處理複雜、長週期軟體工程任務方面已建立顯著優勢,開源模型需要更創新的訓練方法來縮小差距。
AI 代理在軟體開發生命週期中的自主性將顯著提升。
GPT-5.5 在「代理式使用案例」中的優異表現,以及其處理多步驟、長週期任務的能力,預示著 AI 將能更獨立地執行從錯誤修復到功能實現的複雜開發工作。
⏳ 時間線
2024-03
Datacurve 成立並完成種子輪融資 220 萬美元。
2025-04
DeepSWE-Preview (基於 Qwen3-32B) 首次發布,在 SWE-Bench-Verified 上達到 59.0% 的成績,成為開源模型中的領先者。
2025-06
Datacurve 完成 A 輪融資 1500 萬美元。
2025-07
DeepSWE-Preview 被報導為使用強化學習訓練的 32B 程式碼代理,在 SWE-Bench-Verified 上表現出色。
2026-05
Datacurve 推出 DeepSWE 基準測試,揭示頂尖模型間的顯著效能差距,並將 GPT-5.5 評為領先者。
📎 來源 (18)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗