📱較早收集於 10m

阿里巴巴 Qwen3.7-Max 登頂國產大模型榜首

阿里巴巴 Qwen3.7-Max 登頂國產大模型榜首
PostLinkedIn
📱閱讀原文: Ifanr (爱范儿)

💡Qwen3.7-Max 現已成為排名最高的國產大模型,性能基準測試僅次於 Claude Opus。

⚡ 30-Second TL;DR

有什麼變化

Qwen3.7-Max 現已成為排名最高的國產大模型。

為什麼重要

這一里程碑標誌著中國國產模型與頂級全球 AI 競爭對手之間的性能差距顯著縮小。它為開發者提供了一個強大且符合本地合規要求的高階推理任務替代方案。

下一步行動

透過阿里雲 API 評估 Qwen3.7-Max,確認其是否符合您在複雜推理任務上的生產需求。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen3.7-Max 現已成為排名最高的國產大模型。
  • 基準測試表現顯示其僅次於 Claude Opus。
  • QuestMobile 報告顯示 AI 原生 App 月活躍用戶數達 4.61 億。

🧠 深度解析

Web-grounded analysis with 15 cited sources.

🔑 增強重點摘要

  • Qwen3.7-Max 被設計為 AI Agent 的基礎模型,能夠處理複雜的任務,例如程式編寫、偵錯、辦公工作流程自動化以及數百甚至數千步驟的自主執行。
  • 該模型在程式編程 Agent 基準測試中表現強勁,例如 Terminal Bench 2.0-Terminus 獲得 69.7 分,超越了 DeepSeek-v4-pro-Max 和 Claude-Opus4.6,並在 SWE-bench Verified 中表現出色。
  • Qwen3.7-Max 展現出強大的跨框架泛化能力,在 Claude Code、OpenClaw 和 Qwen Code 等多種 AI Agent 執行環境中均能保持一致的性能。
  • 阿里巴巴正大力投資 AI 和雲端基礎設施,計劃在未來三年內投入至少 3,800 億人民幣(約 524.4 億美元),顯示 Qwen 系列是其 AI 競爭策略的核心。
  • Qwen 模型,包括 Qwen3.7-Max,可透過千問 App、PC 和網頁平台免費試用,使其廣泛地供使用者使用。
📊 競品分析▸ Show
模型/基準測試Qwen3.7-MaxClaude Opus 4.6/4.7DeepSeek-v4-pro-Max
Artificial Analysis 全球大模型榜單得分56.6 (全球第五,國產第一)--
Terminal Bench 2.0-Terminus (程式編程 Agent)69.7低於 Qwen3.7-Max67.9
SWE-bench Verified (程式編程)80.480.8 (Opus 4.6 Max)80.6
GPQA Diamond (推理)92.491.3 (Opus 4.6)-
HLE (推理)41.440.0 (Opus 4.6)-
HMMT 2026 Feb (推理)97.196.2 (Opus 4.6)-
IMOAnswerBench (推理)90.0-89.8
IFBench (指令遵循)79.1-77.0
通用 Agent 能力 (MCP-Atlas, MCP-Mark, Skillbench)超越 GLM5.1, Kimi-K2.6--
定價千問 App、PC、網頁端免費試用輸入 $5/百萬 Token,輸出 $25/百萬 Token (Opus 4.7)-

🛠️ 技術深入

  • Qwen3.7-Max 被建構為通用 Agent 的基礎模型,旨在處理程式編寫、偵錯、辦公工作流程自動化及數百至數千步驟的自主執行等任務。
  • 模型支援「保留思考」(preserve_thinking)功能,能夠保留先前互動中的推理內容,這對於長時間的 AI Agent 任務非常有益。
  • 阿里巴巴同時強化其 AI 晶片和雲端基礎設施,包括 T-Head 新 AI 處理器 Zhenwu M890(性能較前代提升 3 倍,配備 144GB GPU 記憶體和 800GB/s 晶片間頻寬,支援 FP32 至 FP4 數值精度)以及 Panjiu AL128 超級節點伺服器(單機架整合 128 個 AI 加速器),以支援大規模 AI Agent 推理和模型訓練。
  • Qwen 系列模型具備多模態能力,支援文字、視覺、音訊和程式碼處理。
  • Qwen3 系列(Qwen3.7-Max 所屬)引入了「混合推理」機制,將「快思考」(非推理模式)與「慢思考」(深度推理模式)整合於同一模型中。
  • Qwen 模型採用寬鬆的 Apache 2.0 協議開源,支援 119 種語言和方言。
  • Qwen 模型提供從 0.5B 到超過 200B 參數規模的不同尺寸供選擇。

🔮 前景展望AI analysis grounded in cited sources

阿里巴巴的 Qwen 系列將鞏固其作為全球領先開源 AI 模型供應商的地位。
Qwen 系列在開源社群的影響力已超越 Llama,全球下載量超過 3 億次,並被新加坡 AISG 和日本企業等國際實體採用,顯示其持續的全球擴張潛力。
Qwen3.7-Max 對 AI Agent 能力的專注將加速 AI 在複雜企業工作流程中的應用。
Qwen3.7-Max 能夠處理多步驟、長時間的自主任務、程式編寫和辦公自動化,直接滿足了 AI 從簡單問答轉向積極參與業務流程的需求。
來自 Qwen3.7-Max 等國產模型的競爭加劇將促使全球 AI 模型價格戰更加激烈。
隨著國產模型達到與國際領先者媲美的性能,市場重點將轉向成本效益和效率,從而推動 API 定價下降並增加所有供應商的壓力。

時間線

2023-04-07
阿里巴巴雲宣布通義千問對企業使用者開啟內測
2023-04-11
阿里巴巴正式發布大語言模型工具「通義千問」
2023-09-13
阿里雲宣布通義千問正式向社會公眾開放
2023-10-31
阿里雲發布千億級參數大模型通義千問2.0
2025-04-29
新一代模型 Qwen3 正式開源,發布多尺寸模型
2026-05-20
阿里巴巴發布全新一代千問旗艦模型 Qwen3.7-Max

📎 來源 (15)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. unwire.hk
  2. ifeng.com
  3. gigazine.net
  4. chinadaily.com.cn
  5. 163.com
  6. smzdm.com
  7. impress.co.jp
  8. wikipedia.org
  9. wikipedia.org
  10. chinatimes.com
  11. crntt.com
  12. trae.cn
  13. tencent.com
  14. nikkei.com
  15. eastmoney.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Ifanr (爱范儿)