⚛️量子位•較早收集於 58m
Qwen 3.7 在全球編程基準測試中排名第二

💡阿里巴巴的 Qwen 3.7 現已成為頂尖編程模型,在全球基準測試中僅次於 Claude。
⚡ 30-Second TL;DR
有什麼變化
Qwen 3.7 在全球編程能力排名中位居第二。
為什麼重要
此排名顯示了編程專用大型語言模型競爭格局的轉變,證明了非美國模型正逐漸與頂尖的西方替代方案達到同等水平。
下一步行動
在您的下一個編程助手項目中,透過 Alibaba Cloud API 評估 Qwen 3.7,並將其推理能力與 Claude 3.5 Sonnet 進行比較。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen 3.7 在全球編程能力排名中位居第二。
- •該模型被公認為全球編程大型語言模型的第一梯隊。
- •阿里巴巴的模型表現現已足以媲美 Anthropic 的 Claude 等行業領先者。
🧠 深度解析
Web-grounded analysis with 19 cited sources.
🔑 增強重點摘要
- •Qwen 3.7-Max 於 2026 年 5 月 20 日在阿里巴巴雲峰會上正式發布,作為一款專有、僅限 API 存取的模型,這標誌著阿里巴巴旗艦模型與其歷史上開放權重發布策略的不同。
- •該模型具備 100 萬個 token 的上下文窗口,相較於 Qwen 3.6 Max Preview 的 256K 有顯著提升,使其能夠在單次請求中處理大型程式碼庫或大量文件。
- •Qwen 3.7-Max 在代理編程、辦公室自動化和長時間自主任務方面表現出色,例如能夠從單一提示生成互動式網路應用程式,並在內部測試中實現超過 35 小時的自主執行,期間進行了 1,000 多次工具調用。
- •除了編程能力,Qwen 3.7-Max 在 GPQA Diamond (92.4%) 和 HMMT 2026 Feb (97.1%) 等高難度推理基準測試中取得了領先成果,並在 WMT24++ (85.8%) 和 MAXIFE (89.2%) 上展現了頂級的多語言理解和翻譯品質。
- •該模型設計用於「跨框架泛化」,意味著它可以作為多種代理框架的智慧層,包括原生支援 Anthropic API 協定,允許與 Claude Code 等現有工具整合。
📊 競品分析▸ Show
| 特性/基準 | Qwen 3.7-Max | Claude Opus 4.7 |
|---|---|---|
| 發布日期 | 2026 年 5 月 20 日 | 2026 年 4 月 |
| 輸入價格 (每百萬 token) | $2.50 | $5.00 |
| 輸出價格 (每百萬 token) | $7.50 | $25.00 |
| 上下文窗口 | 100 萬 token (原生 262K,可透過 YaRN 擴展) | 100 萬 token (Opus 4.6 測試版) |
| SWE-Pro (編程) | 60.6 (領先) | - (Opus 4.6 在 SWE-Verified 為 80.8) |
| Terminal Bench 2.0-Terminus (代理編程) | 69.7 (領先) | 43.2% (Opus 4, 高運算模式下 50.0%) |
| GPQA Diamond (研究生級推理) | 92.4% (領先 Opus 4.6 的 91.3%) | 91.3% (Opus 4.6) |
| HMMT 2026 Feb (數學競賽) | 97.1% (領先) | 96.2% (Opus 4.6) |
| 代理編程任務成本 (實際測試) | 約 $1.30 | 超過 $12.00 |
| 主要優勢 | 卓越的代理編程、長上下文處理、成本效益高、多語言能力強 | 頂級推理、複雜多步驟任務、企業級工作流程 |
🛠️ 技術深入
- 模型架構:Qwen 3.7-Max 採用稀疏混合專家 (Mixture-of-Experts, MoE) 架構,該設計僅啟動與每個輸入 token 最相關的參數子集,以較低的運算成本提供大型密集模型的推理深度。
- 上下文窗口:模型支援 100 萬個 token 的上下文窗口,其中原生上下文窗口為 262K token,可透過 YaRN 技術擴展。
- 訓練方法:採用多階段訓練流程,包括對高品質推理數據進行持續預訓練、對指令和思維鏈追蹤進行監督式微調,以及透過強化學習優化推理品質。
- 推理模式:內建「思維模式」(thinking mode),該模式會觸發一個深思熟慮的過程,模型在輸出回應前會進行規劃、驗證和精煉,從而提高品質但會增加延遲。
- 多語言能力:Qwen 模型系列以其強大的多語言支援而聞名,Qwen 3 系列支援多達 119 種語言和方言。
🔮 前景展望AI analysis grounded in cited sources
中國 AI 模型在全球競爭力中顯著提升。
Qwen 3.7-Max 在多個頂級基準測試中超越或媲美領先的西方模型,顯示中國在 AI 前沿領域的實力。
AI 代理和自主任務執行將成為主流應用。
Qwen 3.7-Max 專為長時間自主執行和複雜代理工作流程設計,預示著 AI 在自動化軟體開發和企業任務中的廣泛應用。
頂級 AI 模型的成本效益將成為市場競爭的關鍵因素。
Qwen 3.7-Max 在特定代理編程任務中以顯著更低的成本實現了優於 Claude 的結果,可能引發 AI 服務的價格戰。
⏳ 時間線
2023-04
阿里巴巴推出 Qwen (通義千問) 的測試版。
2023-08
阿里巴巴發布首個開源模型 Qwen-7B 及 Qwen-7B-Chat。
2024-06
阿里巴巴發布開源模型 Qwen2 系列。
2025-01
阿里巴巴推出 Qwen2.5-Max 模型。
2025
Qwen 3 系列發布,包含密集型和 MoE 變體,並增強多語言和代理能力。
2026-05-20
阿里巴巴在 2026 年阿里巴巴雲峰會上正式發布 Qwen 3.7-Max。
📎 來源 (19)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
