🔥較早收集於 8h

阿里巴巴 Qwen3.7-Max 躋身全球模型前五

阿里巴巴 Qwen3.7-Max 躋身全球模型前五
PostLinkedIn
🔥閱讀原文: 36氪

💡全新國產旗艦模型 Qwen3.7-Max 躋身全球前五,性能直逼 GPT 與 Claude。

⚡ 30-Second TL;DR

有什麼變化

Qwen3.7-Max 獲得 56.6 分,位列全球第五、國產第一。

為什麼重要

Qwen3.7-Max 的崛起為開發者提供了一個強大的替代選擇,特別是針對需要優異中文能力與符合國內基礎設施規範的應用場景。

下一步行動

透過阿里雲百煉平台接入 Qwen3.7-Max API,並針對您目前的中文任務需求與現有模型進行效能對比測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen3.7-Max 獲得 56.6 分,位列全球第五、國產第一。
  • 性能表現接近 GPT、Claude 和 Gemini 等頂尖模型。
  • 該模型即將透過阿里雲百煉平台對外提供 API 服務。

🧠 深度解析

Web-grounded analysis with 20 cited sources.

🔑 增強重點摘要

  • Qwen3.7-Max 專為智能體 (Agent) 應用而設計,在程式設計、智能體能力和推理方面實現了顯著突破,能夠自主完成複雜的長週期任務。
  • 該模型展現了在全新晶片平台上自主優化推理核心的能力,在長達35小時的任務中,透過自主編程和超過1000次工具調用,實現了10倍的推理速度提升。
  • 在多項程式設計基準測試中,Qwen3.7-Max 的表現超越了 DeepSeek-v4-pro-Max 和 Claude-Opus4.6 等頂尖模型,例如在 Terminal Bench 2.0-Terminus 獲得 69.7 分。
  • ArtificialAnalysis 被業界公認為最具影響力的大模型第三方評測平台之一,其榜單透過多維度基準測試和性能評估,提供系統性的綜合排名。
  • 阿里巴巴雲正進行「芯-雲-模型-推理」全棧智能體化升級,包括發布自研 AI 晶片真武 M890 和磐久 AL128 超節點伺服器,以全面支援智能體時代的需求。
📊 競品分析▸ Show
特性/模型Qwen3.7-Max (阿里巴巴)GPT (OpenAI)Claude (Anthropic)Gemini (Google)
整體性能ArtificialAnalysis 總榜 56.6 分,全球第五,國產第一,逼近頂尖模型。GPT-5.4 (xhigh) 等頂尖模型,Qwen3.7-Max 逼近其性能。Claude-Opus4.7 (max) 等頂尖模型,Qwen3.7-Max 逼近其性能。Gemini3.1 Pro Preview 等頂尖模型,Qwen3.7-Max 逼近其性能。
程式設計能力在 SWE-Pro、SWE-Multilingual、SciCode 等程式設計智能體評測中領先,Terminal Bench 2.0-Terminus 得分 69.7,超越 DeepSeek-v4-pro-Max 和 Claude-Opus4.6。在生態系統深度和整合方面表現出色。在正確性和結構化輸出方面表現突出,SWE-Verified 評測中 Opus-4.6 Max 得分 80.8。擅長處理大規模專案和速度,擁有 1M-token 上下文。
推理能力在 GPQA Diamond、HLE、HMMT 2026 Feb 等推理核心評測中超越 Claude-Opus4.6 及所有國產模型。具備強大的推理能力。具備強大的推理能力。在數學、物理、複雜程式碼生成等需要深度邏輯推理的任務上表現突出。
智能體能力面向智能體全新設計,可與多種 Agent 框架協同,自主完成 35 小時超長程複雜任務,在辦公自動化基準 SpreadsheetBench-v1 上獲 87 分。具備智能體能力。具備智能體能力。具備智能體能力,Google I/O 大會上宣布 Gemini 從 AI 助手全面轉向自主執行任務的 Agent。
定價透過阿里雲百煉平台提供 API 服務,支援 Token Plan 靈活抵扣,降低開發與運行成本。 商業版模型,不開源權重,採用阿里雲商業許可協議。API 價格較高。Claude Opus API 價格較高。Gemini Pro 在基準測試中領先,價格也較高。
多模態能力Qwen 系列涵蓋文字、視覺、音訊、代碼等多模態能力。 Qwen3.7-Plus 等版本將覆蓋視覺智能體需求。具備多模態能力。具備多模態能力。原生多模態,從設計之初就統一處理文本、代碼、圖像、音訊、視訊等多種資訊。

🛠️ 技術深入

  • Qwen3.7-Max 是阿里巴巴 Qwen 系列的最新旗艦模型,其前身 Qwen3-Max 擁有超過 1 兆參數,並使用 36 兆個 token 進行預訓練。
  • 模型架構遵循 Qwen3 系列的設計範式,整合了阿里巴巴提出的全局批次負載平衡損失 (global-batch load balancing loss)。
  • 採用混合專家 (MoE) 架構,以確保訓練的穩定性和效率。
  • 透過 PAI-FlashMoE 的高效多級管線並行策略優化,Qwen3-Max-Base 的訓練效率相較於 Qwen2.5-Max-Base 提升了 30% 的 MFU (Model FLOPs Utilization)。
  • 針對長上下文訓練場景,模型採用 ChunkFlow 策略,實現了 3 倍的吞吐量提升。
  • Qwen3.7-Max 是一個專有閉源模型,其權重不開源,僅透過阿里雲商業許可協議提供雲端調用服務。
  • 阿里巴巴雲已發布自研 AI 晶片真武 M890,具備 144GB 顯存和 800GB/s 的互聯頻寬,性能是上一代真武 810E 的 3 倍。
  • 搭載真武 M890 晶片的磐久 AL128 超節點伺服器,由 128 張 AI 晶片組成,P2P 時延低於 150ns,旨在解決智能體場景下的海量並行推理和大模型訓練需求。

🔮 前景展望AI analysis grounded in cited sources

阿里巴巴雲將鞏固其作為領先 AI 基礎設施提供商的地位。
透過「芯-雲-模型-推理」全棧智能體化升級,包括自研 AI 晶片和 Qwen3.7-Max 模型,阿里巴巴能夠提供全面且整合的 AI 解決方案,吸引更多企業用戶。
Qwen3.7-Max 模型將加速企業應用中 AI 智能體的開發和採用。
其專為智能體設計,在程式設計、推理和長週期自主任務執行方面的突破,直接滿足了企業複雜自動化和智能應用需求。
全球大語言模型市場的競爭將加劇,尤其是在專業智能體能力方面。
Qwen3.7-Max 在智能體特定基準測試中的強勁表現,以及與 GPT、Claude 和 Gemini 等頂級全球模型的直接比較,表明其在這一關鍵領域對既有領導者構成日益增長的挑戰。

時間線

2023-04-07
阿里巴巴雲正式宣布通義千問 (Qwen) 並開啟企業內測。
2023-09-13
阿里巴巴雲正式向社會公眾開放通義千問。
2024-05-11
推出 Qwen-Max-0428 模型,並透過 API 和 Qwen Chat 提供服務。
2025-01-28
發布 Qwen2.5-Max,一個使用超過 20 兆 token 預訓練的大規模 MoE 模型。
2025-09-06
宣布推出 Qwen3-Max-Preview (Instruct),參數超過 1 兆,為當時最大最強模型。
2026-01-26
正式發布旗艦推理模型 Qwen3-Max-Thinking,性能媲美 GPT-5.2 和 Gemini 3 Pro。
2026-05-18
Qwen3.7-Max 和 Qwen3.7-Plus 穩定版發布。
2026-05-20
阿里巴巴在 2026 阿里雲峰會上正式發布新一代旗艦模型 Qwen3.7-Max。
2026-05-20
ArtificialAnalysis 公布最新全球大模型榜單,Qwen3.7-Max 獲得 56.6 分,位列全球第五、國產第一。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪