Qwen3.5 對 Qwen3 基準測試視覺化

💡視覺化基準差異顯示 Qwen3.5 優於 Qwen3—快速選出贏家。(38字元)
⚡ 30-Second TL;DR
有什麼變化
平均官方發布頁面的分數
為什麼重要
提供快速效能比較,指導研究與部署的模型選擇。
下一步行動
存取貼文中連結的 Google Sheet,分析特定基準指標。
關鍵要點
- •平均官方發布頁面的分數
- •顏色條形圖:紫/藍為 Qwen3.5,橙/黃為 Qwen3
- •依圖例順序排序,小型模型部分資料缺失
- •Google Sheet 連結提供原始基準資料
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •Qwen3.5 採用極端稀疏性架構,擁有397億參數但每次前向傳遞僅激活17億參數,相比Qwen3-Max在256K上下文環境下實現19倍解碼速度提升[1][2]
- •Qwen3.5-35B-A3B模型僅3億活躍參數即超越前代Qwen3-235B-A22B的22億活躍參數,證明架構創新和數據質量優於單純參數規模擴展[4]
- •Qwen3.5支持100萬令牌上下文窗口,在OmniDocBench v1.5文檔識別任務中達到90.8分,超越GPT-5.2(85.7分)、Claude Opus 4.5(87.7分)和Gemini 3 Pro(88.5分)[1][3]
- •Qwen3.5在Artificial Analysis Intelligence Index排名第三,僅次於GLM-5和K2.5,在Alibaba Cloud定價為輸入令牌¥0.8/百萬、輸出令牌¥4.8/百萬,約為Gemini 3 Pro成本的1/18[2]
- •Qwen3.5採用FP8精度管道將運行所需記憶體減少50%,在萬億令牌規模下速度提升超過10%,並支持201種語言和方言的多語言覆蓋[1][3]
📊 競品分析▸ Show
| 特性 | Qwen3.5-397B-A17B | Qwen3-Max | Gemini 3 Pro | Claude Opus 4.5 | GPT-5.2 |
|---|---|---|---|---|---|
| 參數規模 | 397B總參數/17B活躍 | >1T | 未公開 | 未公開 | 未公開 |
| 推理速度 | 基準 | 1x(19x慢於Qwen3.5) | 未指定 | 未指定 | 未指定 |
| 文檔識別(OmniDocBench) | 90.8 | 未測試 | 88.5 | 87.7 | 85.7 |
| 具身推理(ERQA) | 67.5 | 未測試 | 70.5 | 未測試 | 未測試 |
| 上下文窗口 | 100萬令牌 | 未指定 | 未指定 | 未指定 | 未指定 |
| 輸入令牌定價 | $0.12/百萬 | 未公開 | ~$2.16/百萬 | 未公開 | 未公開 |
| 排名(Artificial Analysis) | 第三 | 未排名 | 未排名 | 未排名 | 未排名 |
🛠️ 技術深入
• 混合注意力機制:採用Gated DeltaNet線性注意力與Gated Attention混合架構,線性注意力層將上下文壓縮為固定大小狀態,大幅降低KV快取記憶體需求[3][4] • 高稀疏混合專家(MoE)架構:Qwen3-Next架構引入更高稀疏度MoE,每個令牌僅路由通過3-17億參數,使35B-A3B模型可在8GB+ VRAM GPU上運行GGUF量化版本[3][4] • 多令牌預測:支持多令牌預測機制,增強推理能力和代理行為[2][3] • FP8精度管道:原生FP8處理(8位精度而非標準16位),將記憶體需求減少50%,在萬億令牌規模下速度提升超過10%[1] • 異構並行化:基礎設施支持異構並行化以提升吞吐量並降低記憶體消耗[3] • 大規模強化學習:在文本和多模態環境中進行強化學習,增強多步規劃和通用代理行為[3] • 原生多模態訓練:支持圖像理解、視頻處理、文檔分析和空間推理任務,詞彙表擴大以提高編碼效率[3] • 自適應工具使用:內置搜尋、代碼解釋和自適應推理工具,支持100萬令牌上下文窗口[2][3]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。

