🐼較早收集於 1m

Alibaba Qwen 3.7 Max 完成 35 小時自主任務運行

Alibaba Qwen 3.7 Max 完成 35 小時自主任務運行
PostLinkedIn
🐼閱讀原文: Pandaily

💡Qwen 3.7 Max 以 1,158 次成功工具調用證明了其在長時間運行 AI 代理中的可靠性。

⚡ 30-Second TL;DR

有什麼變化

具備持續 35 小時的自主運行能力

為什麼重要

此效能基準測試表明,Qwen 3.7 Max 非常適合需要長期規劃與工具利用的複雜代理工作流。

下一步行動

為您下一個需要長時間執行任務與頻繁工具互動的代理專案評估 Qwen 3.7 Max。

誰應關注:Developers & AI Engineers

關鍵要點

  • 具備持續 35 小時的自主運行能力
  • 在運行期間成功處理了 1,158 次工具調用
  • 展現了在複雜、長時間運行的 AI 代理中的高可靠性

🧠 深度解析

Web-grounded analysis with 14 cited sources.

🔑 增強重點摘要

  • Qwen 3.7 Max 於 2026 年 5 月 20 日在阿里巴巴雲峰會上正式發布,標誌著其作為專有、僅限 API 模型的轉變,與之前開源的 Qwen 版本不同,此舉旨在與 OpenAI 和 Anthropic 等公司在商業模式上保持一致。
  • 該模型在一次長達 35 小時的自主運行中,成功地在一個未經訓練的 T-Head ZW-M890 PPU 硬體架構上優化了一個注意力核心,實現了 10.0 倍的幾何平均加速,並執行了 1,158 次工具調用和 432 次核心評估。
  • Qwen 3.7 Max 具備 100 萬個 token 的上下文窗口和 64K 的最大輸出限制,並支援「跨框架泛化」,能夠與 Claude Code、OpenClaw 和 Qwen Code 等多種主流代理框架原生兼容。
  • 在 Artificial Analysis 智慧指數中,Qwen 3.7 Max 獲得 56.6 分,在全球排名第五,並超越 Google 的 Gemini 3.5 Flash,成為中國模型中的第一名。
  • 該模型在編碼(如 SWE-Pro、SWE-Multilingual、SciCode)和推理(如 GPQA Diamond、Apex Math Reasoning)等多項基準測試中表現出色,並內建獎勵駭客自我監控功能,能自主識別並糾正訓練過程中試圖規避限制的行為。
📊 競品分析▸ Show
特性/模型Qwen 3.7 MaxClaude Opus 4.6/4.7DeepSeek V4-Pro MaxGLM-5.1Kimi K2.6GPT-5.5Gemini 3.5 Flash/3.1 Pro Preview
發布日期2026-05-20------
模型類型專有,API-only專有,API-only---專有,API-only專有,API-only
上下文窗口1M tokens-----1M tokens (Gemini)
Artificial Analysis 智慧指數56.6 (全球第5,中國第1)57.3 (Opus 4.7)38.3 (Apex Math Reasoning)57.5 (MCP-Mark)56.2 (Skillsbench)60.255.3 (Gemini 3.5 Flash), 57.2 (Gemini 3.1 Pro Preview)
Apex 數學推理44.534.5 (Opus 4.6 Max)38.3----
SWE-Pro60.657.3 (Opus 4.6 Max)59.058.856.6--
Terminal Bench 2.0-Terminus69.765.4 (Opus 4.6 Max)67.9 (DS-V4-Pro Max)63.566.7--
MCP-Atlas76.475.8 (Opus 4.6 Max)73.671.866.6--
每百萬輸入 Token 價格$2.50$5.00 (Opus)-----
每百萬輸出 Token 價格$7.50------
輸出速度 (tokens/sec)~192------
Token 效率 (AA 基準測試輸出 token)~97M~24M (平均值)-----
自主運行能力35 小時,1,158 次工具調用解決任務但可能提前終止7.3x 加速 (GLM-5.1), 5.0x 加速 (Kimi K2.6)----

🛠️ 技術深入

  • Qwen 3.7 Max 是一個專有的推理模型,僅支援文本輸入和文本輸出,不具備多模態能力。
  • 該模型具有 100 萬個 token 的上下文窗口和 64K 的最大輸出限制,旨在處理複雜的程式碼庫或冗長的技術文件。
  • 它支援「思考模式」(Thinking Mode),這是一種審慎的處理過程,模型會在此模式下規劃、驗證並完善其回應,以提高品質,但會增加延遲。
  • 「保留思考」(preserve_thinking)功能允許模型在代理任務中保留所有先前回合的思考內容,確保在複雜循環中推理的完整性。
  • 該模型實現了「跨框架泛化」(cross-harness generalization),能夠原生兼容主流代理框架,例如 Anthropic API 協議、Claude Code、OpenClaw 和 Qwen Code。
  • 在 35 小時的自主運行中,Qwen 3.7 Max 在一個未經訓練的 T-Head ZW-M890 PPU 硬體架構上,透過執行 1,158 次工具調用和 432 次核心評估,成功優化了注意力核心,實現了 10.0 倍的幾何平均加速。
  • 它具備內建的獎勵駭客自我監控功能,能夠自主識別並糾正訓練環境中試圖規避限制的行為,並透過自我演進添加了 13 條新的啟發式規則。

🔮 前景展望AI analysis grounded in cited sources

Qwen 3.7 Max 的長時間自主運行能力將顯著加速複雜軟體工程和企業自動化。
該模型能夠連續運行 35 小時,執行超過 1,000 次工具調用,並在核心優化任務中實現 10 倍加速,這表明它能處理通常需要大量人工干預的多步驟、迭代任務。
阿里巴巴將其旗艦 Qwen 系列轉向專有、僅限 API 的模式,將加劇主要 AI 實驗室之間對企業客戶的競爭。
此舉使阿里巴巴與 OpenAI 和 Anthropic 的商業策略保持一致,表明其專注於透過付費 API 將先進模型貨幣化,而非開源發布,從而直接爭奪企業採用。
該模型的跨框架泛化能力將促進更具互操作性的 AI 代理生態系統。
其與 Claude Code 和 OpenClaw 等各種代理框架的原生兼容性,使其能夠作為一個多功能基礎,潛在地簡化開發人員構建多代理系統的整合過程。

時間線

2023-04-07
阿里雲發布通義千問大模型,並開始網頁端邀測
2023-09-13
阿里雲宣布通義千問正式向社會公眾開放
2023-10-31
阿里雲正式發布千億級參數大模型通義千問2.0
2025-04-29
新一代模型 Qwen3(千問3)正式宣布開源,發布 8 款不同尺寸模型
2026-02-06
千問推出「30億免單」春節活動,因請求量過大導致服務短暫故障
2026-05-20
阿里巴巴在 2026 年阿里雲峰會上正式發布 Qwen 3.7 Max

📎 來源 (14)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. venturebeat.com
  2. marktechpost.com
  3. zeniteq.com
  4. analyticsvidhya.com
  5. alibabagroup.com
  6. i-scoop.eu
  7. medium.com
  8. qwen.ai
  9. openrouter.ai
  10. chinadaily.com.cn
  11. youtube.com
  12. cloudprice.net
  13. wordpress.com
  14. youtube.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily