🐼Pandaily•較早收集於 1m
Alibaba Qwen 3.7 Max 完成 35 小時自主任務運行

💡Qwen 3.7 Max 以 1,158 次成功工具調用證明了其在長時間運行 AI 代理中的可靠性。
⚡ 30-Second TL;DR
有什麼變化
具備持續 35 小時的自主運行能力
為什麼重要
此效能基準測試表明,Qwen 3.7 Max 非常適合需要長期規劃與工具利用的複雜代理工作流。
下一步行動
為您下一個需要長時間執行任務與頻繁工具互動的代理專案評估 Qwen 3.7 Max。
誰應關注:Developers & AI Engineers
關鍵要點
- •具備持續 35 小時的自主運行能力
- •在運行期間成功處理了 1,158 次工具調用
- •展現了在複雜、長時間運行的 AI 代理中的高可靠性
🧠 深度解析
Web-grounded analysis with 14 cited sources.
🔑 增強重點摘要
- •Qwen 3.7 Max 於 2026 年 5 月 20 日在阿里巴巴雲峰會上正式發布,標誌著其作為專有、僅限 API 模型的轉變,與之前開源的 Qwen 版本不同,此舉旨在與 OpenAI 和 Anthropic 等公司在商業模式上保持一致。
- •該模型在一次長達 35 小時的自主運行中,成功地在一個未經訓練的 T-Head ZW-M890 PPU 硬體架構上優化了一個注意力核心,實現了 10.0 倍的幾何平均加速,並執行了 1,158 次工具調用和 432 次核心評估。
- •Qwen 3.7 Max 具備 100 萬個 token 的上下文窗口和 64K 的最大輸出限制,並支援「跨框架泛化」,能夠與 Claude Code、OpenClaw 和 Qwen Code 等多種主流代理框架原生兼容。
- •在 Artificial Analysis 智慧指數中,Qwen 3.7 Max 獲得 56.6 分,在全球排名第五,並超越 Google 的 Gemini 3.5 Flash,成為中國模型中的第一名。
- •該模型在編碼(如 SWE-Pro、SWE-Multilingual、SciCode)和推理(如 GPQA Diamond、Apex Math Reasoning)等多項基準測試中表現出色,並內建獎勵駭客自我監控功能,能自主識別並糾正訓練過程中試圖規避限制的行為。
📊 競品分析▸ Show
| 特性/模型 | Qwen 3.7 Max | Claude Opus 4.6/4.7 | DeepSeek V4-Pro Max | GLM-5.1 | Kimi K2.6 | GPT-5.5 | Gemini 3.5 Flash/3.1 Pro Preview |
|---|---|---|---|---|---|---|---|
| 發布日期 | 2026-05-20 | - | - | - | - | - | - |
| 模型類型 | 專有,API-only | 專有,API-only | - | - | - | 專有,API-only | 專有,API-only |
| 上下文窗口 | 1M tokens | - | - | - | - | - | 1M tokens (Gemini) |
| Artificial Analysis 智慧指數 | 56.6 (全球第5,中國第1) | 57.3 (Opus 4.7) | 38.3 (Apex Math Reasoning) | 57.5 (MCP-Mark) | 56.2 (Skillsbench) | 60.2 | 55.3 (Gemini 3.5 Flash), 57.2 (Gemini 3.1 Pro Preview) |
| Apex 數學推理 | 44.5 | 34.5 (Opus 4.6 Max) | 38.3 | - | - | - | - |
| SWE-Pro | 60.6 | 57.3 (Opus 4.6 Max) | 59.0 | 58.8 | 56.6 | - | - |
| Terminal Bench 2.0-Terminus | 69.7 | 65.4 (Opus 4.6 Max) | 67.9 (DS-V4-Pro Max) | 63.5 | 66.7 | - | - |
| MCP-Atlas | 76.4 | 75.8 (Opus 4.6 Max) | 73.6 | 71.8 | 66.6 | - | - |
| 每百萬輸入 Token 價格 | $2.50 | $5.00 (Opus) | - | - | - | - | - |
| 每百萬輸出 Token 價格 | $7.50 | - | - | - | - | - | - |
| 輸出速度 (tokens/sec) | ~192 | - | - | - | - | - | - |
| Token 效率 (AA 基準測試輸出 token) | ~97M | ~24M (平均值) | - | - | - | - | - |
| 自主運行能力 | 35 小時,1,158 次工具調用 | 解決任務但可能提前終止 | 7.3x 加速 (GLM-5.1), 5.0x 加速 (Kimi K2.6) | - | - | - | - |
🛠️ 技術深入
- Qwen 3.7 Max 是一個專有的推理模型,僅支援文本輸入和文本輸出,不具備多模態能力。
- 該模型具有 100 萬個 token 的上下文窗口和 64K 的最大輸出限制,旨在處理複雜的程式碼庫或冗長的技術文件。
- 它支援「思考模式」(Thinking Mode),這是一種審慎的處理過程,模型會在此模式下規劃、驗證並完善其回應,以提高品質,但會增加延遲。
- 「保留思考」(preserve_thinking)功能允許模型在代理任務中保留所有先前回合的思考內容,確保在複雜循環中推理的完整性。
- 該模型實現了「跨框架泛化」(cross-harness generalization),能夠原生兼容主流代理框架,例如 Anthropic API 協議、Claude Code、OpenClaw 和 Qwen Code。
- 在 35 小時的自主運行中,Qwen 3.7 Max 在一個未經訓練的 T-Head ZW-M890 PPU 硬體架構上,透過執行 1,158 次工具調用和 432 次核心評估,成功優化了注意力核心,實現了 10.0 倍的幾何平均加速。
- 它具備內建的獎勵駭客自我監控功能,能夠自主識別並糾正訓練環境中試圖規避限制的行為,並透過自我演進添加了 13 條新的啟發式規則。
🔮 前景展望AI analysis grounded in cited sources
Qwen 3.7 Max 的長時間自主運行能力將顯著加速複雜軟體工程和企業自動化。
該模型能夠連續運行 35 小時,執行超過 1,000 次工具調用,並在核心優化任務中實現 10 倍加速,這表明它能處理通常需要大量人工干預的多步驟、迭代任務。
阿里巴巴將其旗艦 Qwen 系列轉向專有、僅限 API 的模式,將加劇主要 AI 實驗室之間對企業客戶的競爭。
此舉使阿里巴巴與 OpenAI 和 Anthropic 的商業策略保持一致,表明其專注於透過付費 API 將先進模型貨幣化,而非開源發布,從而直接爭奪企業採用。
該模型的跨框架泛化能力將促進更具互操作性的 AI 代理生態系統。
其與 Claude Code 和 OpenClaw 等各種代理框架的原生兼容性,使其能夠作為一個多功能基礎,潛在地簡化開發人員構建多代理系統的整合過程。
⏳ 時間線
2023-04-07
阿里雲發布通義千問大模型,並開始網頁端邀測
2023-09-13
阿里雲宣布通義千問正式向社會公眾開放
2023-10-31
阿里雲正式發布千億級參數大模型通義千問2.0
2025-04-29
新一代模型 Qwen3(千問3)正式宣布開源,發布 8 款不同尺寸模型
2026-02-06
千問推出「30億免單」春節活動,因請求量過大導致服務短暫故障
2026-05-20
阿里巴巴在 2026 年阿里雲峰會上正式發布 Qwen 3.7 Max
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗
