🇭🇰SCMP Technology•較早收集於 30m
阿里巴巴 Qwen3.7-Max 在程式編寫能力上超越 OpenAI 與 Google

💡首個進入全球程式編寫基準測試前五名的非美國模型,挑戰了 OpenAI 與 Google 的主導地位。
⚡ 30-Second TL;DR
有什麼變化
Qwen3.7-Max 在 Code Arena 程式編寫排行榜上獲得 1,541 分。
為什麼重要
此排名挑戰了美國 AI 實驗室在專業程式編寫任務中的主導地位。這表明阿里巴巴的 Qwen 系列正成為高風險軟體開發工作流程中,具備競爭力的企業級替代方案。
下一步行動
透過 API 評估 Qwen3.7-Max,並將其效能與您目前的程式編寫助手或自動化程式碼生成流程進行基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen3.7-Max 在 Code Arena 程式編寫排行榜上獲得 1,541 分。
- •阿里巴巴是目前除 Anthropic 之外,唯一佔據前五名位置的開發者。
- •該模型在表現上超越了來自 OpenAI 和 Google 的競爭對手模型。
🧠 深度解析
Web-grounded analysis with 24 cited sources.
🔑 增強重點摘要
- •Code Arena是由知名第三方大模型盲測平台LMArena推出,其評測方式獨特,要求模型從零開始生成完整的、可互動的Web應用程式,並由全球開發者進行匿名盲測投票,而非傳統的孤立程式碼片段或演算法題測試,因此被認為是目前全球最具公信力的AI程式編寫能力評測之一。
- •Qwen3.7-Max專為智能體(Agent)工作負載設計,在長程自主執行能力上實現了顯著突破,能夠在複雜任務中連續運行長達35小時,並執行超過1000次工具調用,且全程無上下文退化或指令漂移。
- •該模型在成本效益上具有顯著優勢,其輸出Token成本比Anthropic的Claude Opus 4.7便宜約3.3倍,比OpenAI的GPT-5.5便宜約4倍,同時在特定程式編寫任務中展現出可媲美甚至超越對手的性能。
- •Qwen3.7-Max是中國自研大模型首次在程式編寫這一「皇冠賽道」殺入全球第一梯隊,打破了過去一年幾乎由Claude系列壟斷Code Arena前四名的格局,成為前五名中唯一的非Anthropic模型。
- •相較於前代Qwen3.6,Qwen3.7-Max在性能上實現了多項優化,包括處理大型輸入數據時延遲降低25%,記憶體效率提升(需要更少的GPU資源),並支援多模態輸入(文本、表格和半結構化數據)。
📊 競品分析▸ Show
| 模型名稱 | 開發者 | Code Arena分數 | 輸入Token價格 (每百萬) | 輸出Token價格 (每百萬) | 上下文窗口 | 主要優勢/特點 |
|---|---|---|---|---|---|---|
| Qwen3.7-Max | 阿里巴巴 | 1541 | $1.25 | $3.75 | 1M tokens | 智能體導向、長程自主執行、高成本效益、多模態輸入 |
| Claude Opus 4.7 | Anthropic | 1567±10 | $5 | $25 | 1M tokens | 程式編寫和智能體AI編碼工具的行業標準 |
| Claude Opus 4.6 Thinking | Anthropic | 1562±10 或 1551±8 | $5 | $25 | 1M tokens | 程式編寫和智能體AI編碼工具的行業標準 |
| GPT-5.5 | OpenAI | 低於Qwen3.7-Max | N/A | 約為Qwen3.7-Max的4倍 | N/A | 業界領先的通用AI模型,在多項基準測試中表現優異 |
| Gemini 3.5 Flash | 低於Qwen3.7-Max | N/A | 相較同類模型成本減半 | N/A | 強大的智能體和程式編寫模型,性能超越Gemini 3.1 Pro |
🛠️ 技術深入
- Qwen3.7-Max是阿里巴巴Qwen3.7系列的旗艦模型,專為智能體(Agent)工作負載設計,特別擅長程式編寫、辦公自動化和長程自主執行任務。
- 支援純文本輸入和輸出,具有高達1,000,000個Token的上下文窗口,最大輸出Token數為65,536。
- 採用混合專家(Mixture-of-Experts, MoE)架構,結合了推理、視覺和多語言性能,並針對高吞吐量配置進行了優化。
- 引入了動態上下文窗口擴展、增強的Token表示和優化的多頭注意力模組,以提高對特定領域術語的理解和推理清晰度。
- 具備顯式提示緩存功能,可有效重複利用上下文,提升效率。
- 新增領域自適應工具包,允許對特定行業數據集進行微調,並提供綜合評估指標,自動評分生成輸出。
- 原生支援多模態輸入,可處理文本、表格和半結構化數據。
- 在自主程式設計任務中,該模型能夠連續運行35小時,執行超過1158次工具調用,且在整個過程中沒有上下文退化、指令漂移或死循環。
- 在無文檔、無參考程式碼的全新芯片平台上,Qwen3.7-Max能從零獨立完成內核編寫、編譯、性能分析與迭代優化,最終程式碼相較Triton參考實現達到最高10倍的幾何平均加速。
🔮 前景展望AI analysis grounded in cited sources
阿里巴巴在程式編寫AI領域的強勁表現將加劇全球智能體AI開發的競爭。
Qwen3.7-Max在Code Arena的突破性排名及其以智能體為中心的設計,預示著AI競爭正從對話聊天轉向「能幹活的程式設計Agent」,促使其他大模型廠商加速其智能體能力的發展。
Qwen3.7-Max的成本效益將加速其在全球開發者和企業市場的採用,尤其是在價格敏感的地區。
相較於西方領先模型顯著更低的Token成本,Qwen3.7-Max為大規模AI部署提供了極具吸引力的價值主張,可能導致市場份額的重新分配。
該模型對長程自主執行和多模態能力的重視,將使其成為推動企業高級自動化的關鍵基礎模型。
Qwen3.7-Max能夠處理複雜、多步驟的任務並整合多種數據類型,使其非常適合需要高度自動化和智能決策的企業級應用。
⏳ 時間線
2023-04
阿里巴巴雲正式發布通義千問(Qwen)大語言模型,並邀請企業用戶進行內測。
2023-09
通義千問正式向社會公眾開放使用。
2023-11
發布Qwen-72B和Qwen-72B-Chat,以及Qwen-1.8B和Qwen-1.8B-Chat模型。
2025-04
新一代模型Qwen3正式開源,發布涵蓋0.6B至235B參數的8款Qwen3系列模型。
2026-05-18
Qwen3.7 Max和Qwen3.7 Plus穩定版發布。
2026-05-26
Qwen3.7-Max在Code Arena程式編寫排行榜上獲得1,541分,位列全球第四。
📎 來源 (24)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: SCMP Technology ↗
