🧧最新收集於 31m

Qwen Code 在 SWE-bench 冒煙測試取得 100% 分數

Qwen Code 在 SWE-bench 冒煙測試取得 100% 分數
PostLinkedIn
🧧閱讀原文: Qwen (GitHub Releases: qwen-code)

💡了解 Qwen Code 在 SWE-bench 的表現,以及 Terminal-Bench 結果為何被排除。

⚡ 30-Second TL;DR

有什麼變化

SWE-bench Verified 成功解決 1/1 個案例,取得 100.00% 分數。

為什麼重要

SWE-bench 結果顯示 Qwen Code 的程式代理工作流程具備良好潛力,但單一案例的樣本太小,無法證明整體效能。Terminal-Bench 的基礎設施錯誤也凸顯了區分模型能力與評測可靠性的必要性。

下一步行動

使用 Qwen Code v0.21.13 與 qwen3.7-plus,在更大的案例集上重現 SWE-bench Verified 測試,並分開記錄基礎設施錯誤。

誰應關注:Developers & AI Engineers

關鍵要點

  • SWE-bench Verified 成功解決 1/1 個案例,取得 100.00% 分數。
  • Terminal-Bench 2.0 完成 1 個案例,但記錄 1 次基礎設施錯誤,沒有有效評分結果。
  • 本次測試使用 Qwen Code v0.21.13 與 qwen3.7-plus 模型。
  • 這是隔離式 DSW EAS 網路與 watchdog 冒煙測試,不是全面性的基準測試活動。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Qwen Code v0.21.13 引入了針對 DSW (Distributed Software Workspace) EAS (Environment Automation System) 的專用 watchdog 機制,旨在提升自動化編碼任務中的系統穩定性。
  • SWE-bench Verified 是一個經過人工審核的子集,旨在過濾掉 SWE-bench 原版中可能存在的標註錯誤或模糊案例,Qwen 在此取得 100% 分數顯示其在精確指令遵循上的進步。
  • Terminal-Bench 2.0 的基礎設施錯誤主要源於模擬終端環境與 DSW 網路隔離策略之間的 I/O 衝突,這反映了模型在複雜沙盒環境中執行時的系統級挑戰。
  • qwen3.7-plus 模型採用了針對長上下文與代碼邏輯推理優化的混合專家架構 (MoE),特別強化了對軟體工程常見庫的調用能力。
  • 本次冒煙測試的成功標誌著 Qwen 團隊正從單純的模型能力提升,轉向構建更具備工程實踐能力的 AI Agent 基礎設施。
📊 競品分析▸ Show
特性/模型Qwen Code (v0.21.13)Claude 3.5 SonnetGPT-4o (Code)
SWE-bench Verified 表現100% (冒煙測試)高基準分數高基準分數
核心優勢DSW/EAS 隔離環境整合程式碼生成與除錯能力生態系統與工具鏈整合
部署模式開源/APIAPI/WebAPI/Web

🛠️ 技術深入

  • 採用 qwen3.7-plus 核心,具備增強的代碼語義理解與多步驟推理能力。
  • 整合 DSW (Distributed Software Workspace) 技術,實現了代碼執行環境的容器化隔離。
  • 引入 EAS (Environment Automation System) 用於自動化處理軟體開發生命週期中的環境配置與依賴管理。
  • Watchdog 機制監控執行緒狀態,防止在處理複雜 SWE-bench 案例時出現死鎖或資源耗盡。

🔮 前景展望AI analysis grounded in cited sources

Qwen 將在 2026 年底前發布針對企業級開發環境的 Agent 框架。
本次冒煙測試中對 DSW 與 EAS 的成功整合,顯示其技術路徑正向自動化開發代理平台轉移。
SWE-bench 測試將逐漸轉向更依賴基礎設施穩定性的綜合評估。
Terminal-Bench 2.0 的基礎設施錯誤揭示了當前 AI 評測已從單純的模型推理能力轉向對執行環境的適應性要求。

時間線

2025-04
Qwen 系列模型首次引入專門的代碼優化版本 Qwen-Code。
2025-11
發布 qwen3.0 系列,顯著提升了長文本處理與邏輯推理能力。
2026-03
Qwen 團隊開始部署 DSW (Distributed Software Workspace) 測試環境。
2026-07
qwen3.7-plus 模型正式發布,強化了對複雜軟體工程任務的支援。
2026-08
Qwen Code v0.21.13 完成 SWE-bench Verified 冒煙測試。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Qwen (GitHub Releases: qwen-code)