🧧最新收集於 15m

Qwen Code 通過回歸煙霧測試

Qwen Code 通過回歸煙霧測試
PostLinkedIn
🧧閱讀原文: Qwen (GitHub Releases: qwen-code)

💡了解 Qwen Code v0.21.14 是否在兩套基準測試中維持程式代理可靠性。

⚡ 30-Second TL;DR

有什麼變化

Qwen Code v0.21.14 通過一項 SWE-bench Verified 回歸案例,取得 100% 分數。

為什麼重要

結果顯示,此版本 Qwen Code 在兩項選定的程式代理任務上維持了功能正常。不過,每項基準測試僅有一個案例,樣本過小,無法支持對整體可靠性或基準效能的廣泛結論。

下一步行動

在升級正式環境的程式代理工作流程前,使用 Qwen Code v0.21.14 執行符合自身場景的 SWE-bench 與 Terminal-Bench 子集測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen Code v0.21.14 通過一項 SWE-bench Verified 回歸案例,取得 100% 分數。
  • 它也成功解決一項 Terminal-Bench 2.0 案例,沒有執行或基礎設施故障。
  • 煙霧測試使用 qwen3.7-plus 模型,並記錄了成功的基準測試工作流程執行結果。
  • 每項基準測試僅包含一個案例,因此結果僅具方向性,不能代表全面效能。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 26 個來源。

🔑 增強重點摘要

  • Qwen Code是一個開源的AI代理,專為終端機設計,旨在幫助開發者理解大型程式碼庫、自動化繁瑣工作並加速交付。
  • Qwen Code支援互動式終端機、無頭和程式化執行、代理客戶端協議 (ACP)、長時間運行的HTTP守護程式、Web和IDE客戶端(如VS Code、JetBrains、Zed)以及訊息通道適配器。
  • SWE-bench Verified是一個由人工策劃的基準測試,包含500個來自開源Python儲存庫的真實GitHub問題,旨在嚴格評估自動程式修復系統(包括LLM和代理LLM框架)解決實際問題的能力。
  • Terminal-Bench 2.0是一個包含89個不同任務的基準測試套件,用於測試AI模型在真實終端機環境中端到端完成編碼和操作工作流程的能力,這要求模型能夠檢查環境、讀寫文件、執行命令並從錯誤中恢復。
  • 本次煙霧測試中使用的qwen3.7-plus模型是一個多模態模型,具有1,000,000個token的上下文視窗和可配置的深度思考模式,能夠對圖像、螢幕截圖、文件和視覺輸入進行推理。
📊 競品分析▸ Show
模型/產品特點定價 (每百萬token)基準測試表現 (SWE-bench Verified / Terminal-Bench 2.0)
Qwen Code (基於Qwen模型)開源AI代理,終端機優先,支援多協議API (OpenAI, Anthropic, Gemini, Qwen),具備代理記憶、自動技能、子代理、代理團隊、IDE插件、桌面應用程式、守護程式模式、SDK和IM機器人。Qwen3.7-Plus: 輸入 $0.32 / 輸出 $1.28Qwen 3.6 35B-A3B: 73.4% / 51.5%;Qwen 3.8 27B: 61.7% (SWE-bench Pro) / 73.0% (Terminal Bench 2.1)
DeepSeek開源,在程式碼生成和數學方面表現出色,擅長代理任務和推理,提供1M token上下文。DeepSeek V4 Pro/Flash: 輸入 $0.27 - $1.10在開源模型中程式碼生成基準測試中名列前茅
Llama (Meta)開源,Llama 4 Scout支援10M token上下文,Llama 4 Maverick在程式碼基準測試上媲美或超越GPT-5.3。-Llama 4 Maverick在HumanEval和SWE-bench上表現出色
Claude (Anthropic)專有模型,Claude Opus 4.8擅長長上下文寫作和分析,Claude Opus 4.7常用於程式設計和程式碼生成。-Claude Opus 4.6 Max: 53.4% (SWE-bench Pro)
Gemini (Google)多模態生成式AI模型,理解並結合文本、圖像、音訊、影片和程式碼,Gemini 3擅長多模態工作,Gemini 3 Flash Preview適用於程式碼。--
GPT (OpenAI)專有模型,GPT-5.2是多功能首選,GPT-4o在程式碼生成和修復方面與Qwen2.5 Coder 32B Instruct相當。-GPT-4o在Aider程式碼修復基準測試中與Qwen2.5 Coder 32B Instruct表現相當 (73.7%)
Mistral開源,Mistral Large 3和Mistral Small 4在Apache 2.0下發布,Mistral Small 4可在單個消費級GPU上運行。Mistral Large 3: 輸入 $2 - $6在Artificial Analysis指數上表現良好

🛠️ 技術深入

  • Qwen Code是一個單一儲存庫 (monorepo),支援互動式終端機、無頭和程式化執行、代理客戶端協議 (ACP)、長時間運行的HTTP守護程式、Web和IDE客戶端以及訊息通道適配器。
  • 該系統可透過多個層次進行擴展:MCP伺服器可添加工具、提示和資源;擴展和技能可打包可重用命令;通道插件可適配訊息平台;SDK客戶端可構建自訂應用程式;UI適配器可將守護程式事件投射到主機特定狀態和呈現。
  • Qwen Code利用HTTP + 伺服器傳送事件 (SSE) 控制平面圍繞ACP執行,以支援多客戶端、工作區範圍的運行時。
  • qwen3.7-plus模型具有1,000,000個token的上下文視窗,支援多模態輸入(文本和圖像),並提供可配置的深度思考模式。
  • Qwen3-Coder(一個相關模型)採用了龐大的480B參數混合專家 (MoE) 架構,每次查詢僅使用35B參數以提高計算效率,並原生支援256K token視窗,可擴展至1M token。
  • Qwen模型基於Transformer架構,並在注意力機制、訓練方法和多語言能力方面進行了創新。
  • Qwen3模型使用Qwen的tokenizer (qwen),該tokenizer實現了位元組級別的位元組對編碼 (BBPE),詞彙量為151,669。
  • Qwen 3.8採用混合層堆疊,交替使用高效的線性注意力 (linear attention) 和完整的門控注意力 (gated attention),其中75%的深度用於常規處理的快速線性注意力,而其餘25%則用於最困難推理步驟的完整注意力。

🔮 前景展望AI analysis grounded in cited sources

AI編碼代理將在軟體開發生命週期中扮演更核心的角色。
Qwen Code在SWE-bench Verified和Terminal-Bench 2.0上的成功,以及其代理能力(如理解程式碼庫、自動化任務、除錯和生成測試),表明這類工具正從輔助功能轉變為能夠自主執行複雜工程任務。
對於AI編碼模型而言,終端機操作和多步驟推理的基準測試將變得越來越重要。
Terminal-Bench 2.0和SWE-bench Verified等基準測試的設計旨在評估模型在真實終端機環境中執行多步驟、長週期任務的能力,這反映了業界對AI代理在實際軟體工程工作流程中表現的日益增長的需求,而非僅僅是單一函數生成。
多模態能力將成為下一代AI編碼工具的關鍵差異化因素。
Qwen3.7-plus模型支援圖像、螢幕截圖和文件等多模態輸入,並能進行視覺語言理解,這使得AI編碼工具能夠更好地理解設計稿、錯誤截圖或文件,從而更全面地協助開發工作。

時間線

2023-04
阿里巴巴推出Qwen測試版,名為通義千問
2024-08-13
OpenAI與SWE-bench作者合作發布SWE-bench Verified基準測試
2025-05-14
Qwen3技術報告發布,介紹Qwen3系列模型,包括密集型和MoE架構
2026-03-12
Terminal-Bench 2.0基準測試發布,旨在評估AI代理在真實終端機環境中的多步驟任務能力
2026-05
Qwen3.7 Plus模型發布,具有100萬token上下文視窗和多模態輸入能力
2026-08-02
Qwen 3.8-Max正式發布,是Qwen家族迄今為止最強大的模型,並首次開源Max級模型的權重
2026-08-18
Qwen Code v0.21.14 (或其前身v0.21.13) 成功通過SWE-bench Verified和Terminal-Bench 2.0的煙霧測試
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Qwen (GitHub Releases: qwen-code)

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。