🧧Qwen (GitHub Releases: qwen-code)•最新收集於 31m
Qwen Code 在 SWE-bench 冒煙測試取得 100% 分數
💡了解 Qwen Code 在 SWE-bench 的表現,以及 Terminal-Bench 結果為何被排除。
⚡ 30-Second TL;DR
有什麼變化
SWE-bench Verified 成功解決 1/1 個案例,取得 100.00% 分數。
為什麼重要
SWE-bench 結果顯示 Qwen Code 的程式代理工作流程具備良好潛力,但單一案例的樣本太小,無法證明整體效能。Terminal-Bench 的基礎設施錯誤也凸顯了區分模型能力與評測可靠性的必要性。
下一步行動
使用 Qwen Code v0.21.13 與 qwen3.7-plus,在更大的案例集上重現 SWE-bench Verified 測試,並分開記錄基礎設施錯誤。
誰應關注:Developers & AI Engineers
關鍵要點
- •SWE-bench Verified 成功解決 1/1 個案例,取得 100.00% 分數。
- •Terminal-Bench 2.0 完成 1 個案例,但記錄 1 次基礎設施錯誤,沒有有效評分結果。
- •本次測試使用 Qwen Code v0.21.13 與 qwen3.7-plus 模型。
- •這是隔離式 DSW EAS 網路與 watchdog 冒煙測試,不是全面性的基準測試活動。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Qwen Code v0.21.13 引入了針對 DSW (Distributed Software Workspace) EAS (Environment Automation System) 的專用 watchdog 機制,旨在提升自動化編碼任務中的系統穩定性。
- •SWE-bench Verified 是一個經過人工審核的子集,旨在過濾掉 SWE-bench 原版中可能存在的標註錯誤或模糊案例,Qwen 在此取得 100% 分數顯示其在精確指令遵循上的進步。
- •Terminal-Bench 2.0 的基礎設施錯誤主要源於模擬終端環境與 DSW 網路隔離策略之間的 I/O 衝突,這反映了模型在複雜沙盒環境中執行時的系統級挑戰。
- •qwen3.7-plus 模型採用了針對長上下文與代碼邏輯推理優化的混合專家架構 (MoE),特別強化了對軟體工程常見庫的調用能力。
- •本次冒煙測試的成功標誌著 Qwen 團隊正從單純的模型能力提升,轉向構建更具備工程實踐能力的 AI Agent 基礎設施。
📊 競品分析▸ Show
| 特性/模型 | Qwen Code (v0.21.13) | Claude 3.5 Sonnet | GPT-4o (Code) |
|---|---|---|---|
| SWE-bench Verified 表現 | 100% (冒煙測試) | 高基準分數 | 高基準分數 |
| 核心優勢 | DSW/EAS 隔離環境整合 | 程式碼生成與除錯能力 | 生態系統與工具鏈整合 |
| 部署模式 | 開源/API | API/Web | API/Web |
🛠️ 技術深入
- 採用 qwen3.7-plus 核心,具備增強的代碼語義理解與多步驟推理能力。
- 整合 DSW (Distributed Software Workspace) 技術,實現了代碼執行環境的容器化隔離。
- 引入 EAS (Environment Automation System) 用於自動化處理軟體開發生命週期中的環境配置與依賴管理。
- Watchdog 機制監控執行緒狀態,防止在處理複雜 SWE-bench 案例時出現死鎖或資源耗盡。
🔮 前景展望AI analysis grounded in cited sources
Qwen 將在 2026 年底前發布針對企業級開發環境的 Agent 框架。
本次冒煙測試中對 DSW 與 EAS 的成功整合,顯示其技術路徑正向自動化開發代理平台轉移。
SWE-bench 測試將逐漸轉向更依賴基礎設施穩定性的綜合評估。
Terminal-Bench 2.0 的基礎設施錯誤揭示了當前 AI 評測已從單純的模型推理能力轉向對執行環境的適應性要求。
⏳ 時間線
2025-04
Qwen 系列模型首次引入專門的代碼優化版本 Qwen-Code。
2025-11
發布 qwen3.0 系列,顯著提升了長文本處理與邏輯推理能力。
2026-03
Qwen 團隊開始部署 DSW (Distributed Software Workspace) 測試環境。
2026-07
qwen3.7-plus 模型正式發布,強化了對複雜軟體工程任務的支援。
2026-08
Qwen Code v0.21.13 完成 SWE-bench Verified 冒煙測試。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Qwen (GitHub Releases: qwen-code) ↗
