🦙較早收集於 75m

Qwen3.5 對 Qwen3 基準測試視覺化

Qwen3.5 對 Qwen3 基準測試視覺化
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡視覺化基準差異顯示 Qwen3.5 優於 Qwen3—快速選出贏家。(38字元)

⚡ 30-Second TL;DR

有什麼變化

平均官方發布頁面的分數

為什麼重要

提供快速效能比較,指導研究與部署的模型選擇。

下一步行動

存取貼文中連結的 Google Sheet,分析特定基準指標。

誰應關注:Researchers & Academics

關鍵要點

  • 平均官方發布頁面的分數
  • 顏色條形圖:紫/藍為 Qwen3.5,橙/黃為 Qwen3
  • 依圖例順序排序,小型模型部分資料缺失
  • Google Sheet 連結提供原始基準資料

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Qwen3.5 採用極端稀疏性架構,擁有397億參數但每次前向傳遞僅激活17億參數,相比Qwen3-Max在256K上下文環境下實現19倍解碼速度提升[1][2]
  • Qwen3.5-35B-A3B模型僅3億活躍參數即超越前代Qwen3-235B-A22B的22億活躍參數,證明架構創新和數據質量優於單純參數規模擴展[4]
  • Qwen3.5支持100萬令牌上下文窗口,在OmniDocBench v1.5文檔識別任務中達到90.8分,超越GPT-5.2(85.7分)、Claude Opus 4.5(87.7分)和Gemini 3 Pro(88.5分)[1][3]
  • Qwen3.5在Artificial Analysis Intelligence Index排名第三,僅次於GLM-5和K2.5,在Alibaba Cloud定價為輸入令牌¥0.8/百萬、輸出令牌¥4.8/百萬,約為Gemini 3 Pro成本的1/18[2]
  • Qwen3.5採用FP8精度管道將運行所需記憶體減少50%,在萬億令牌規模下速度提升超過10%,並支持201種語言和方言的多語言覆蓋[1][3]
📊 競品分析▸ Show
特性Qwen3.5-397B-A17BQwen3-MaxGemini 3 ProClaude Opus 4.5GPT-5.2
參數規模397B總參數/17B活躍>1T未公開未公開未公開
推理速度基準1x(19x慢於Qwen3.5)未指定未指定未指定
文檔識別(OmniDocBench)90.8未測試88.587.785.7
具身推理(ERQA)67.5未測試70.5未測試未測試
上下文窗口100萬令牌未指定未指定未指定未指定
輸入令牌定價$0.12/百萬未公開~$2.16/百萬未公開未公開
排名(Artificial Analysis)第三未排名未排名未排名未排名

🛠️ 技術深入

混合注意力機制:採用Gated DeltaNet線性注意力與Gated Attention混合架構,線性注意力層將上下文壓縮為固定大小狀態,大幅降低KV快取記憶體需求[3][4]高稀疏混合專家(MoE)架構:Qwen3-Next架構引入更高稀疏度MoE,每個令牌僅路由通過3-17億參數,使35B-A3B模型可在8GB+ VRAM GPU上運行GGUF量化版本[3][4]多令牌預測:支持多令牌預測機制,增強推理能力和代理行為[2][3]FP8精度管道:原生FP8處理(8位精度而非標準16位),將記憶體需求減少50%,在萬億令牌規模下速度提升超過10%[1]異構並行化:基礎設施支持異構並行化以提升吞吐量並降低記憶體消耗[3]大規模強化學習:在文本和多模態環境中進行強化學習,增強多步規劃和通用代理行為[3]原生多模態訓練:支持圖像理解、視頻處理、文檔分析和空間推理任務,詞彙表擴大以提高編碼效率[3]自適應工具使用:內置搜尋、代碼解釋和自適應推理工具,支持100萬令牌上下文窗口[2][3]

🔮 前景展望AI analysis grounded in cited sources

稀疏架構將成為大型語言模型的主流設計範式
Qwen3.5證明17億活躍參數可匹配1兆參數模型的推理性能,同時成本和速度優勢顯著,預示著未來模型設計將優先考慮參數效率而非絕對規模[1][2]
中國AI實驗室在推理和編碼基準上與美國頂級模型的差距將進一步縮小
Qwen3.5在Artificial Analysis排名第三,Qwen3.5-27B在SWE-bench Verified上與GPT-5 mini並駕齊驅(72.4分),表明中國模型在三個月內可追上美國最新進展[2][4]
開源密集模型將在特定應用場景中與閉源模型競爭
Qwen3.5-27B完全開源密集模型在文檔識別和編碼任務上超越多個閉源模型,使開發者能在本地部署高性能模型而無需依賴API[3][4]

時間線

2025-12
Qwen3.5系列模型發布,包括397B-A17B、122B-A10B、35B-A3B和27B密集模型
2026-01
Qwen3.5在Artificial Analysis Intelligence Index排名第三,超越多個競爭對手
2026-02
Reddit r/LocalLLaMA社區用戶發布Qwen3.5與Qwen3基準測試視覺化對比分析
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。