🧧Qwen (GitHub Releases: qwen-code)•最新收集於 45m
Qwen Code 完成完整端到端基準測試重跑
💡了解 Qwen Code 如何在更嚴格的依賴控制下驗證完整的發布至基準測試流程。
⚡ 30-Second TL;DR
有什麼變化
使用的基準版本為 Qwen v0.21.12。
為什麼重要
這次重跑為 Qwen Code 在程式設計與終端機使用基準上的軟體工程流程,提供更受控的驗證。將套件代理存取限制在驗證器依賴套件的對外流量,也可能提升評測隔離性與可重現性。
下一步行動
以 Qwen v0.21.12 作為參考版本,重現 500 題 SWE-bench 與 89 項 Terminal-Bench 流程,並將依賴套件對外流量限制在驗證器代理內。
誰應關注:Developers & AI Engineers
關鍵要點
- •使用的基準版本為 Qwen v0.21.12。
- •端到端流程評估了 500 題 DSW SWE-bench Verified 任務。
- •Terminal-Bench 2.0 評測包含 89 項任務。
- •DSW 套件代理的範圍僅限於驗證器依賴套件的對外流量。
- •完整重跑後重新發布了相同版本。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Qwen Code 的 DSW (Data Science Workshop) 環境整合了專門針對軟體工程任務優化的代理執行框架,旨在解決複雜代碼庫的自動化修復問題。
- •SWE-bench Verified 基準測試集由 500 個經過人工審核的 GitHub Issue 組成,旨在提供比原始 SWE-bench 更高質量的評估標準,減少數據污染。
- •Terminal-Bench 2.0 專注於評估模型在真實終端環境(Terminal Environment)中的操作能力,包括文件系統導航、指令執行與錯誤處理。
- •此次重跑流程強調了『可重現性』,透過嚴格控制對外流量與依賴套件,確保評測結果在不同運行環境下的一致性。
- •Qwen v0.21.12 版本在代碼生成與邏輯推理能力上進行了針對性微調,特別強化了對長上下文(Long-context)代碼庫的理解與編輯能力。
📊 競品分析▸ Show
| 特性/模型 | Qwen Code (v0.21.12) | Claude 3.5 Sonnet | GPT-4o (Code) |
|---|---|---|---|
| SWE-bench Verified | 高度優化 | 領先水平 | 領先水平 |
| 終端操作能力 | 強 (Terminal-Bench 2.0) | 中等 | 中等 |
| 開源/閉源 | 開源 (Open Weights) | 閉源 | 閉源 |
| 定價模式 | 免費/自託管 | API 計費 | API 計費 |
🛠️ 技術深入
- 採用基於 Qwen-2.5 或後續架構的代碼專用微調版本,針對程式語言語法與邏輯結構進行深度訓練。
- 實作了基於沙盒(Sandbox)的執行環境,限制代理(Agent)對系統資源的存取權限,僅允許必要的套件依賴流量。
- 整合了多輪對話與反思機制(Reflection Mechanism),允許模型在執行測試失敗後自動分析錯誤日誌並進行代碼修正。
- 支援長序列代碼庫檢索(RAG)與編輯,透過優化的注意力機制處理大規模專案檔案。
🔮 前景展望AI analysis grounded in cited sources
開源代碼模型將在 2027 年前達到與頂尖閉源模型在 SWE-bench 上的效能平價。
隨著評測基準(如 SWE-bench Verified)的透明化與開源社群對代理執行框架的持續優化,模型在複雜任務上的迭代速度正顯著加快。
自動化軟體工程代理將成為企業級開發工具的標準配置。
Qwen Code 等模型在端到端基準測試中的高分表現,證明了 AI 代理在處理真實世界軟體維護任務上的實用性已達商業化門檻。
⏳ 時間線
2024-04
Qwen 2 系列模型發布,奠定代碼與推理能力基礎
2025-01
Qwen Code 專項計畫啟動,專注於軟體工程自動化
2026-03
Terminal-Bench 2.0 發布,強化模型終端操作評測
2026-07
Qwen v0.21.12 版本釋出,引入優化後的代碼生成架構
2026-08
完成 DSW EAS full E2E r3 完整端到端基準測試重跑
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Qwen (GitHub Releases: qwen-code) ↗