🧧Qwen (GitHub Releases: qwen-code)•最新收集於 15m
Qwen Code 通過回歸煙霧測試
💡了解 Qwen Code v0.21.14 是否在兩套基準測試中維持程式代理可靠性。
⚡ 30-Second TL;DR
有什麼變化
Qwen Code v0.21.14 通過一項 SWE-bench Verified 回歸案例,取得 100% 分數。
為什麼重要
結果顯示,此版本 Qwen Code 在兩項選定的程式代理任務上維持了功能正常。不過,每項基準測試僅有一個案例,樣本過小,無法支持對整體可靠性或基準效能的廣泛結論。
下一步行動
在升級正式環境的程式代理工作流程前,使用 Qwen Code v0.21.14 執行符合自身場景的 SWE-bench 與 Terminal-Bench 子集測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen Code v0.21.14 通過一項 SWE-bench Verified 回歸案例,取得 100% 分數。
- •它也成功解決一項 Terminal-Bench 2.0 案例,沒有執行或基礎設施故障。
- •煙霧測試使用 qwen3.7-plus 模型,並記錄了成功的基準測試工作流程執行結果。
- •每項基準測試僅包含一個案例,因此結果僅具方向性,不能代表全面效能。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 26 個來源。
🔑 增強重點摘要
- •Qwen Code是一個開源的AI代理,專為終端機設計,旨在幫助開發者理解大型程式碼庫、自動化繁瑣工作並加速交付。
- •Qwen Code支援互動式終端機、無頭和程式化執行、代理客戶端協議 (ACP)、長時間運行的HTTP守護程式、Web和IDE客戶端(如VS Code、JetBrains、Zed)以及訊息通道適配器。
- •SWE-bench Verified是一個由人工策劃的基準測試,包含500個來自開源Python儲存庫的真實GitHub問題,旨在嚴格評估自動程式修復系統(包括LLM和代理LLM框架)解決實際問題的能力。
- •Terminal-Bench 2.0是一個包含89個不同任務的基準測試套件,用於測試AI模型在真實終端機環境中端到端完成編碼和操作工作流程的能力,這要求模型能夠檢查環境、讀寫文件、執行命令並從錯誤中恢復。
- •本次煙霧測試中使用的qwen3.7-plus模型是一個多模態模型,具有1,000,000個token的上下文視窗和可配置的深度思考模式,能夠對圖像、螢幕截圖、文件和視覺輸入進行推理。
📊 競品分析▸ Show
| 模型/產品 | 特點 | 定價 (每百萬token) | 基準測試表現 (SWE-bench Verified / Terminal-Bench 2.0) |
|---|---|---|---|
| Qwen Code (基於Qwen模型) | 開源AI代理,終端機優先,支援多協議API (OpenAI, Anthropic, Gemini, Qwen),具備代理記憶、自動技能、子代理、代理團隊、IDE插件、桌面應用程式、守護程式模式、SDK和IM機器人。 | Qwen3.7-Plus: 輸入 $0.32 / 輸出 $1.28 | Qwen 3.6 35B-A3B: 73.4% / 51.5%;Qwen 3.8 27B: 61.7% (SWE-bench Pro) / 73.0% (Terminal Bench 2.1) |
| DeepSeek | 開源,在程式碼生成和數學方面表現出色,擅長代理任務和推理,提供1M token上下文。 | DeepSeek V4 Pro/Flash: 輸入 $0.27 - $1.10 | 在開源模型中程式碼生成基準測試中名列前茅 |
| Llama (Meta) | 開源,Llama 4 Scout支援10M token上下文,Llama 4 Maverick在程式碼基準測試上媲美或超越GPT-5.3。 | - | Llama 4 Maverick在HumanEval和SWE-bench上表現出色 |
| Claude (Anthropic) | 專有模型,Claude Opus 4.8擅長長上下文寫作和分析,Claude Opus 4.7常用於程式設計和程式碼生成。 | - | Claude Opus 4.6 Max: 53.4% (SWE-bench Pro) |
| Gemini (Google) | 多模態生成式AI模型,理解並結合文本、圖像、音訊、影片和程式碼,Gemini 3擅長多模態工作,Gemini 3 Flash Preview適用於程式碼。 | - | - |
| GPT (OpenAI) | 專有模型,GPT-5.2是多功能首選,GPT-4o在程式碼生成和修復方面與Qwen2.5 Coder 32B Instruct相當。 | - | GPT-4o在Aider程式碼修復基準測試中與Qwen2.5 Coder 32B Instruct表現相當 (73.7%) |
| Mistral | 開源,Mistral Large 3和Mistral Small 4在Apache 2.0下發布,Mistral Small 4可在單個消費級GPU上運行。 | Mistral Large 3: 輸入 $2 - $6 | 在Artificial Analysis指數上表現良好 |
🛠️ 技術深入
- Qwen Code是一個單一儲存庫 (monorepo),支援互動式終端機、無頭和程式化執行、代理客戶端協議 (ACP)、長時間運行的HTTP守護程式、Web和IDE客戶端以及訊息通道適配器。
- 該系統可透過多個層次進行擴展:MCP伺服器可添加工具、提示和資源;擴展和技能可打包可重用命令;通道插件可適配訊息平台;SDK客戶端可構建自訂應用程式;UI適配器可將守護程式事件投射到主機特定狀態和呈現。
- Qwen Code利用HTTP + 伺服器傳送事件 (SSE) 控制平面圍繞ACP執行,以支援多客戶端、工作區範圍的運行時。
- qwen3.7-plus模型具有1,000,000個token的上下文視窗,支援多模態輸入(文本和圖像),並提供可配置的深度思考模式。
- Qwen3-Coder(一個相關模型)採用了龐大的480B參數混合專家 (MoE) 架構,每次查詢僅使用35B參數以提高計算效率,並原生支援256K token視窗,可擴展至1M token。
- Qwen模型基於Transformer架構,並在注意力機制、訓練方法和多語言能力方面進行了創新。
- Qwen3模型使用Qwen的tokenizer (qwen),該tokenizer實現了位元組級別的位元組對編碼 (BBPE),詞彙量為151,669。
- Qwen 3.8採用混合層堆疊,交替使用高效的線性注意力 (linear attention) 和完整的門控注意力 (gated attention),其中75%的深度用於常規處理的快速線性注意力,而其餘25%則用於最困難推理步驟的完整注意力。
🔮 前景展望AI analysis grounded in cited sources
AI編碼代理將在軟體開發生命週期中扮演更核心的角色。
Qwen Code在SWE-bench Verified和Terminal-Bench 2.0上的成功,以及其代理能力(如理解程式碼庫、自動化任務、除錯和生成測試),表明這類工具正從輔助功能轉變為能夠自主執行複雜工程任務。
對於AI編碼模型而言,終端機操作和多步驟推理的基準測試將變得越來越重要。
Terminal-Bench 2.0和SWE-bench Verified等基準測試的設計旨在評估模型在真實終端機環境中執行多步驟、長週期任務的能力,這反映了業界對AI代理在實際軟體工程工作流程中表現的日益增長的需求,而非僅僅是單一函數生成。
多模態能力將成為下一代AI編碼工具的關鍵差異化因素。
Qwen3.7-plus模型支援圖像、螢幕截圖和文件等多模態輸入,並能進行視覺語言理解,這使得AI編碼工具能夠更好地理解設計稿、錯誤截圖或文件,從而更全面地協助開發工作。
⏳ 時間線
2023-04
阿里巴巴推出Qwen測試版,名為通義千問
2024-08-13
OpenAI與SWE-bench作者合作發布SWE-bench Verified基準測試
2025-05-14
Qwen3技術報告發布,介紹Qwen3系列模型,包括密集型和MoE架構
2026-03-12
Terminal-Bench 2.0基準測試發布,旨在評估AI代理在真實終端機環境中的多步驟任務能力
2026-05
Qwen3.7 Plus模型發布,具有100萬token上下文視窗和多模態輸入能力
2026-08-02
Qwen 3.8-Max正式發布,是Qwen家族迄今為止最強大的模型,並首次開源Max級模型的權重
2026-08-18
Qwen Code v0.21.14 (或其前身v0.21.13) 成功通過SWE-bench Verified和Terminal-Bench 2.0的煙霧測試
📎 來源 (26)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Qwen (GitHub Releases: qwen-code) ↗
每週 AI 簡報
每週一封,可隨時退訂。
