🦙較早收集於 51m

Qwen3.5-35B 在 VLLM A100 基準測試稱霸

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#benchmark#inference#quantization#a100qwen3-30b-a3b-&-qwen3.5-35b-a3bqwenvllma100flashinferflashattn

💡Qwen3.5-35B 在雙 A100 上達 352 tok/s – 本地高效服務首選?(28字)

⚡ 30-Second TL;DR

有什麼變化

Qwen3.5-35B-A3B-AWQ-4bit-FlashInfer:持續時間 222.4 秒,輸出 352.1 tok/s,總計 1356.8 tok/s

為什麼重要

展示 Qwen3.5-35B 在 A100 硬體上的優異推論效率,有助高吞吐量部署降低成本。鼓勵採用 AWQ-4bit 及 FlashInfer 以達最佳效能。

下一步行動

在 VLLM 上使用 FlashInfer 基準測試你的 A100 叢集上的 Qwen3.5-35B-A3B-AWQ-4bit。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen3.5-35B-A3B-AWQ-4bit-FlashInfer:持續時間 222.4 秒,輸出 352.1 tok/s,總計 1356.8 tok/s
  • Qwen3-30B-A3B-FP8-FlashAttn 最慢:288.9 秒,輸出 270.9 tok/s
  • 設定:15 個提示,223k 輸入/78k 輸出 token,tensor-parallel=2,gpu-memory-util=0.8
  • 最高並發:35B AWQ-4bit 達 45,30B AWQ-4bit 約 13.8
  • 最佳預填充速度因較低 KV 快取使用而有利 Qwen3.5

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B採用混合架構,整合線性注意力機制與稀疏混合專家模型(MoE),在推理效率上超越參數規模更大的前代模型,35B模型性能超越235B前代模型[3]
  • Qwen3.5系列於2026年2月24日發布,包含多個規格變體(Flash、35B-A3B、122B-A10B、27B密集模型),體現「更高智能、更低計算」的設計理念[6]
  • Qwen3.5-35B-A3B支援262,144 token的超長上下文窗口,原生支援文本、圖像和視頻多模態輸入,在視覺語言能力上相比Qwen3 VL系列有顯著提升[2][4]

🛠️ 技術深入

  • 架構設計:混合架構結合線性注意力機制與稀疏混合專家模型(MoE),相比密集模型實現更高推理效率[2]
  • 上下文窗口:262,144 token的超長上下文支援,支援Flash Infer和Flash Attention等優化注意力機制[2][5]
  • 多模態能力:原生視覺語言模型,支援文本、圖像和視頻輸入,輸出為文本格式[2]
  • 推理優化:支援推理模式(Reasoning Mode),可展示模型的逐步思考過程,通過web搜索、web提取器和代碼解釋器等工具在複雜問題上實現更高準確度[4][5]
  • 量化支援:提供多種GGUF格式(2至16位元),可在Hugging Face上獲取,支援AWQ 4位元量化等多種量化方案[3]

🔮 前景展望AI analysis grounded in cited sources

MoE架構將成為大型語言模型效率優化的主流方向
Qwen3.5系列通過稀疏混合專家模型實現35B模型超越235B前代性能,驗證了參數效率優於規模擴展的可行性[3]
超長上下文(262K token)將推動企業級應用的文檔處理能力
Qwen3.5-35B-A3B的262,144 token上下文窗口支援複雜多步驟任務,為知識密集型應用提供新的技術基礎[2]

時間線

2025-09-23
Qwen3-Max模型快照發布,支援思考模式與非思考模式
2025-12-01
Qwen3.5-Plus穩定版本發布,支援文本、圖像和視頻輸入
2026-01-23
Qwen3-Max 2026-01-23思考模式快照發布,整合web搜索、web提取器和代碼解釋器工具
2026-02-15
Qwen3.5-Plus 2026-02-15版本發布,預設啟用思考模式
2026-02-24
Qwen3.5系列正式發布,包含Qwen3.5-122B-A10B、Qwen3.5-35B-A3B和Qwen3.5-27B三個主要變體
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。