🐼較早收集於 36m

阿里巴巴預覽 Qwen 3.7 Max 與 Qwen 3 Ultra

阿里巴巴預覽 Qwen 3.7 Max 與 Qwen 3 Ultra
PostLinkedIn
🐼閱讀原文: Pandaily

💡阿里巴巴正同時測試兩款 72B 旗艦模型,預示其 LLM 產品線將迎來重大更新。

⚡ 30-Second TL;DR

有什麼變化

Qwen 3.7 Max 與 Qwen 3 Ultra 現身 LM Arena

為什麼重要

同時開發兩款高性能 72B 模型,凸顯了阿里巴巴在 LLM 領域保持競爭力的積極企圖。

下一步行動

查看 LM Arena 排行榜,比較新款 Qwen 3.7 Max 與現有 SOTA 模型的推理能力。

誰應關注:Researchers & Academics

關鍵要點

  • Qwen 3.7 Max 與 Qwen 3 Ultra 現身 LM Arena
  • 兩款模型均採用 720 億參數架構
  • 同時迭代顯示了多管齊下的旗艦模型策略

🧠 深度解析

Web-grounded analysis with 27 cited sources.

🔑 增強重點摘要

  • Qwen系列模型採用多樣化的架構,包括Transformer解碼器和混合專家(MoE)模型,並在Qwen 3中引入了分組查詢注意力(GQA)和QK-Norm等技術,以優化訓練穩定性和推理效率。
  • 阿里巴巴的Qwen模型家族積極推動開源策略,許多模型採用Apache 2.0許可證,並已建立龐大的衍生模型生態系統,其數量已超越Meta的Llama系列,成為全球最大的生成式語言模型族群之一。
  • Qwen系列在LM Arena等國際基準測試中表現出色,例如Qwen 2.5-Max在數學和編程等技術領域取得領先排名,而Qwen3-Max(萬億參數模型)也曾進入LM Arena前十,顯示其在多項能力上具備頂尖競爭力。
  • Qwen模型支援長上下文處理能力,Qwen 3模型可支援32K至128K的上下文長度,並具備多模態能力,如Qwen-VL可理解長視頻和執行視覺代理任務。
  • 阿里巴巴將Qwen定位為「AI時代的操作系統」,並承諾在未來三年內投入人民幣3,800億元於AI與雲基礎設施,以加速AI技術的商業化和普惠化。
📊 競品分析▸ Show
特徵/模型阿里巴巴 Qwen (3.7 Max/3 Ultra)Meta Llama 3OpenAI GPT-4oAnthropic Claude 3.5 SonnetGoogle Gemini 1.5 ProDeepSeek R1
參數規模720億 (本文提及), Qwen3-Max達萬億700億 (指令微調版)未公開未公開未公開未公開
授權模式多數開源 (Apache 2.0), 部分專有開源權重 (有使用限制)專有專有專有開源
主要特點多模態、編程/數學強項、長上下文、MoE架構高性能、廣泛應用於本地部署通用型、多模態、頂尖性能企業級、安全性、長上下文多模態推理、長上下文、生態整合高效、低成本、開源、推理能力
LM Arena 表現Qwen 2.5-Max 在數學/編程排名第一,Qwen3-Max 曾入前十700億參數指令微調版強於GPT-3.5,但不如GPT-4頂尖模型之一表現出色,與Qwen 2.5-Max競爭頂尖模型之一DeepSeek R1 表現強勁

🛠️ 技術深入

  • 模型架構:採用Transformer解碼器架構,類似Meta的LLaMA模型體系。
  • 關鍵改進:
    • 旋轉位置編碼 (RoPE):取代傳統位置編碼,支援長序列位置關係,並針對長上下文調整基數。
    • 無嵌入權重共享:詞嵌入層和輸出投影層不共享權重,增加表示靈活性。
    • 去除多餘偏置:除注意力機制中的Q/K/V投影層外,其他層不使用偏置項,減少參數和過擬合風險。
    • 歸一化與激活函數:採用RMSNorm替代LayerNorm提高訓練穩定性,使用SwiGLU激活函數提升表達能力。
    • 高效注意力實現:利用FlashAttention優化訓練和推理效率。
  • Qwen 3 模型特有改進:
    • 密集模型結構:引入分組查詢注意力(GQA)和QK-Norm以確保穩定訓練。
    • 混合專家 (MoE) 模型結構:採用細粒度專家分割、全局批次負載均衡損失,並移除共享專家。Qwen3-MoE設計包含128個總專家,每個token激活8個專家。
  • 預訓練:
    • Qwen系列模型預訓練目標為基於大規模語料的自回歸下一個詞預測任務。
    • Qwen 2.5 預訓練數據集規模達18兆個tokens。
    • Qwen 3 預訓練數據量達36兆個tokens,是Qwen 2.5的兩倍,涵蓋119種語言和方言。
    • Qwen 3 預訓練分為三個階段:通用階段(S1)、推理階段(S2)和長上下文階段。
    • 後訓練:實施複雜的監督微調(SFT)和多階段強化學習(RLHF,包括DPO和在線學習)以增強人類偏好和長文本生成能力。
  • 上下文長度:Qwen 3 模型支援32K至128K的上下文長度。
  • 多模態能力:Qwen-VL模型可處理圖像和視頻,支援視覺定位、結構化輸出和長視頻理解(超過1小時)及事件捕捉。

🔮 前景展望AI analysis grounded in cited sources

阿里巴巴多管齊下的旗艦模型策略將加速其在全球AI市場的競爭地位。
同時開發和測試多個高參數模型,允許快速迭代和專業化,以滿足多樣化的市場需求並突破性能界限。
持續強調開源模型將強化阿里巴巴的AI生態系統和影響力。
開源模型促進社區開發,擴大採用範圍,並吸引人才,將Qwen定位為基礎性的「AI操作系統」。
阿里巴巴對AI基礎設施和全棧AI能力的重大投資將推動其商業化並實現宏偉的收入目標。
從晶片到模型和應用程式的強大全棧AI策略,提供了競爭優勢,並為企業提供可擴展、具成本效益的AI解決方案。

時間線

2023-04
阿里巴巴推出Qwen(通義千問)測試版
2023-09
Qwen正式向公眾開放
2024-12
Qwen 2.5模型系列發布,其72B-Instruct模型在Chatbot Arena排名靠前
2025-02
Qwen 2.5-Max在Chatbot Arena的數學和編程單項能力上排名第一
2025-04
Qwen 3系列模型(包含多種尺寸的密集和MoE模型)正式開源
2025-09
阿里巴巴推出萬億參數的Qwen3-Max模型,並首次進入LM Arena前十名
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily