💼較早收集於 28m

DeepSWE 評測挑戰 AI 程式碼排行榜與 GPT-5.5 的領先地位

DeepSWE 評測挑戰 AI 程式碼排行榜與 GPT-5.5 的領先地位
PostLinkedIn
💼閱讀原文: VentureBeat

💡大型程式碼評測審計揭露 32% 錯誤率,並將 GPT-5.5 評為新一代領先者。

⚡ 30-Second TL;DR

有什麼變化

DeepSWE 評估了 113 項任務與 91 個儲存庫,顯示出比以往評測更顯著的效能差距。

為什麼重要

這一發現迫使企業採購團隊重新思考評估 AI 程式碼代理的方式,因為目前的指標可能不可靠。這凸顯了 AI 產業對更強大、無污染評估框架的迫切需求。

下一步行動

停止僅依賴 SWE-Bench Pro 分數;應納入內部的私有程式碼庫評估,以驗證模型是否符合您的特定工程需求。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSWE 評估了 113 項任務與 91 個儲存庫,顯示出比以往評測更顯著的效能差距。
  • GPT-5.5 以 70% 的成功率脫穎而出,大幅領先競爭對手。
  • 審計顯示 SWE-Bench Pro 的自動評分存在 32% 的錯誤率,暗示現有基準測試存在廣泛的不準確性。
  • 該基準測試解決了 GitHub 抓取數據集中固有的數據污染與模型記憶問題。

🧠 深度解析

Web-grounded analysis with 18 cited sources.

🔑 增強重點摘要

  • DeepSWE 的任務比 SWE-Bench Pro 大幅增加,其參考解決方案平均為 668 行程式碼,而 SWE-Bench Pro 的單檔案變更平均為 120 行程式碼,這表明 DeepSWE 旨在評估更複雜、更耗時的軟體工程任務。
  • Datacurve 的審計發現,SWE-Bench Pro 的驗證器存在 8.5% 的誤報率(接受錯誤的實作)和 24% 的漏報率(拒絕正確的實作),而 DeepSWE 的驗證器則具有顯著較低的錯誤率(分別為 0.3% 和 1.1%),這質疑了現有基準測試的可靠性。
  • GPT-5.5 專為「代理式使用案例」進行了優化,即模型需要長時間依序執行多個動作的任務,並且在處理此類任務時比以前的模型快 2-3 倍,這突顯了其在自主軟體工程代理方面的潛力。
  • Datacurve 這家開發 DeepSWE 的公司成立於 2024 年,已籌集 1820 萬美元資金,其核心業務是為大型語言模型 (LLM) 提供精選的程式碼資料,並提供 AI 驅動的開發工具。
  • 儘管 SWE-Bench Pro 存在局限性,但它最初的開發目的是為了解決早期基準測試中存在的資料污染、任務多樣性有限、問題過於簡化以及測試不可靠等挑戰,旨在提供更嚴謹的 AI 代理評估。
📊 競品分析▸ Show
特徵/基準DeepSWESWE-Bench ProSWE-Bench VerifiedHumanEvalTerminal-Bench 2.0
任務數量113 項任務1865 項任務約 500 項任務 (過濾後)164 項程式設計問題測試真實命令列工作流程
儲存庫數量91 個開源儲存庫41 個專業儲存庫 (開源與私有)開源 Python 儲存庫不適用 (函式級別)不適用 (代理式)
任務複雜度長週期軟體工程,平均 668 行程式碼長週期軟體工程,旨在抵抗污染函式級別,易受污染,許多有缺陷函式級別,衡量功能正確性規劃、迭代、工具協調
驗證器錯誤率誤報 0.3%,漏報 1.1%誤報 8.5%,漏報 24% (Datacurve 審計)許多測試案例有缺陷自動單元測試不適用
GPT-5.5 表現70% 成功率 (領先)23.1% (公開集), 14.9% (私有集)不適用 (已飽和)高於 90% (飽和)82.7% (領先)
Claude Opus 表現54% (約)22.7% (公開集), 17.8% (私有集)約 80% (飽和)不適用69.4%
DeepSWE-Preview (Qwen3-32B)不適用不適用59.0% (開源模型第一)不適用不適用

備註:價格資訊未在搜尋結果中明確提及,因此未包含在比較中。

🛠️ 技術深入

  • DeepSWE 基準測試專注於「長週期軟體工程」任務,其任務規模遠大於傳統基準測試,參考解決方案平均包含 668 行程式碼,旨在更真實地反映實際開發挑戰。
  • DeepSWE 的驗證器經過嚴格審計,誤報率僅為 0.3%,漏報率為 1.1%,這顯著優於 SWE-Bench Pro 的驗證器,後者分別為 8.5% 和 24%,確保了評估結果的更高準確性。
  • DeepSWE-Preview 是一個開源程式碼代理,其訓練基於 Qwen3-32B 模型,並完全採用強化學習 (RL) 進行,特別是使用了一種修改後的「解耦優勢策略優化 (Decoupled Advantage Policy Optimization, DAPO)」演算法。
  • DeepSWE 的訓練過程涉及使用來自 R2E-Gym 基準測試的 4,500 個真實世界軟體工程任務,並在 64 個 H100 GPU 上耗時六天完成。
  • GPT-5.5 被描述為一種原生全模態模型,能夠在單一統一架構中處理文字、圖像、音訊和視訊,並且針對代理式使用案例進行了優化,顯著提升了多步驟推理和工具使用的可靠性。
  • GPT-5.5 的 API 支援高達 100 萬個 token 的上下文視窗(在 Codex 中為 40 萬個),這對於處理大型程式碼庫和複雜的軟體工程任務至關重要。

🔮 前景展望AI analysis grounded in cited sources

AI 模型評估標準將加速轉向更複雜、更真實的軟體工程任務。
DeepSWE 揭示了現有基準測試的缺陷,特別是資料污染和任務規模不足,這將促使產業採用更嚴謹、更貼近實際開發的評估方法。
開源 AI 程式碼生成模型將面臨更大的挑戰,以追趕閉源頂尖模型的效能差距。
DeepSWE 的結果顯示 GPT-5.5 大幅領先,這表明閉源模型在處理複雜、長週期軟體工程任務方面已建立顯著優勢,開源模型需要更創新的訓練方法來縮小差距。
AI 代理在軟體開發生命週期中的自主性將顯著提升。
GPT-5.5 在「代理式使用案例」中的優異表現,以及其處理多步驟、長週期任務的能力,預示著 AI 將能更獨立地執行從錯誤修復到功能實現的複雜開發工作。

時間線

2024-03
Datacurve 成立並完成種子輪融資 220 萬美元。
2025-04
DeepSWE-Preview (基於 Qwen3-32B) 首次發布,在 SWE-Bench-Verified 上達到 59.0% 的成績,成為開源模型中的領先者。
2025-06
Datacurve 完成 A 輪融資 1500 萬美元。
2025-07
DeepSWE-Preview 被報導為使用強化學習訓練的 32B 程式碼代理,在 SWE-Bench-Verified 上表現出色。
2026-05
Datacurve 推出 DeepSWE 基準測試,揭示頂尖模型間的顯著效能差距,並將 GPT-5.5 評為領先者。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat