🧧最新收集於 45m

Qwen Code 完成完整端到端基準測試重跑

Qwen Code 完成完整端到端基準測試重跑
PostLinkedIn
🧧閱讀原文: Qwen (GitHub Releases: qwen-code)

💡了解 Qwen Code 如何在更嚴格的依賴控制下驗證完整的發布至基準測試流程。

⚡ 30-Second TL;DR

有什麼變化

使用的基準版本為 Qwen v0.21.12。

為什麼重要

這次重跑為 Qwen Code 在程式設計與終端機使用基準上的軟體工程流程,提供更受控的驗證。將套件代理存取限制在驗證器依賴套件的對外流量,也可能提升評測隔離性與可重現性。

下一步行動

以 Qwen v0.21.12 作為參考版本,重現 500 題 SWE-bench 與 89 項 Terminal-Bench 流程,並將依賴套件對外流量限制在驗證器代理內。

誰應關注:Developers & AI Engineers

關鍵要點

  • 使用的基準版本為 Qwen v0.21.12。
  • 端到端流程評估了 500 題 DSW SWE-bench Verified 任務。
  • Terminal-Bench 2.0 評測包含 89 項任務。
  • DSW 套件代理的範圍僅限於驗證器依賴套件的對外流量。
  • 完整重跑後重新發布了相同版本。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Qwen Code 的 DSW (Data Science Workshop) 環境整合了專門針對軟體工程任務優化的代理執行框架,旨在解決複雜代碼庫的自動化修復問題。
  • SWE-bench Verified 基準測試集由 500 個經過人工審核的 GitHub Issue 組成,旨在提供比原始 SWE-bench 更高質量的評估標準,減少數據污染。
  • Terminal-Bench 2.0 專注於評估模型在真實終端環境(Terminal Environment)中的操作能力,包括文件系統導航、指令執行與錯誤處理。
  • 此次重跑流程強調了『可重現性』,透過嚴格控制對外流量與依賴套件,確保評測結果在不同運行環境下的一致性。
  • Qwen v0.21.12 版本在代碼生成與邏輯推理能力上進行了針對性微調,特別強化了對長上下文(Long-context)代碼庫的理解與編輯能力。
📊 競品分析▸ Show
特性/模型Qwen Code (v0.21.12)Claude 3.5 SonnetGPT-4o (Code)
SWE-bench Verified高度優化領先水平領先水平
終端操作能力強 (Terminal-Bench 2.0)中等中等
開源/閉源開源 (Open Weights)閉源閉源
定價模式免費/自託管API 計費API 計費

🛠️ 技術深入

  • 採用基於 Qwen-2.5 或後續架構的代碼專用微調版本,針對程式語言語法與邏輯結構進行深度訓練。
  • 實作了基於沙盒(Sandbox)的執行環境,限制代理(Agent)對系統資源的存取權限,僅允許必要的套件依賴流量。
  • 整合了多輪對話與反思機制(Reflection Mechanism),允許模型在執行測試失敗後自動分析錯誤日誌並進行代碼修正。
  • 支援長序列代碼庫檢索(RAG)與編輯,透過優化的注意力機制處理大規模專案檔案。

🔮 前景展望AI analysis grounded in cited sources

開源代碼模型將在 2027 年前達到與頂尖閉源模型在 SWE-bench 上的效能平價。
隨著評測基準(如 SWE-bench Verified)的透明化與開源社群對代理執行框架的持續優化,模型在複雜任務上的迭代速度正顯著加快。
自動化軟體工程代理將成為企業級開發工具的標準配置。
Qwen Code 等模型在端到端基準測試中的高分表現,證明了 AI 代理在處理真實世界軟體維護任務上的實用性已達商業化門檻。

時間線

2024-04
Qwen 2 系列模型發布,奠定代碼與推理能力基礎
2025-01
Qwen Code 專項計畫啟動,專注於軟體工程自動化
2026-03
Terminal-Bench 2.0 發布,強化模型終端操作評測
2026-07
Qwen v0.21.12 版本釋出,引入優化後的代碼生成架構
2026-08
完成 DSW EAS full E2E r3 完整端到端基準測試重跑
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Qwen (GitHub Releases: qwen-code)

Qwen Code Completes Full E2E Benchmark Rerun | Qwen (GitHub Releases: qwen-code) | SetupAI | SetupAI