🦙Reddit r/LocalLLaMA•較早收集於 51m
Qwen3.5-35B 在 VLLM A100 基準測試稱霸
#benchmark#inference#quantization#a100qwen3-30b-a3b-&-qwen3.5-35b-a3bqwenvllma100flashinferflashattn
💡Qwen3.5-35B 在雙 A100 上達 352 tok/s – 本地高效服務首選?(28字)
⚡ 30-Second TL;DR
有什麼變化
Qwen3.5-35B-A3B-AWQ-4bit-FlashInfer:持續時間 222.4 秒,輸出 352.1 tok/s,總計 1356.8 tok/s
為什麼重要
展示 Qwen3.5-35B 在 A100 硬體上的優異推論效率,有助高吞吐量部署降低成本。鼓勵採用 AWQ-4bit 及 FlashInfer 以達最佳效能。
下一步行動
在 VLLM 上使用 FlashInfer 基準測試你的 A100 叢集上的 Qwen3.5-35B-A3B-AWQ-4bit。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen3.5-35B-A3B-AWQ-4bit-FlashInfer:持續時間 222.4 秒,輸出 352.1 tok/s,總計 1356.8 tok/s
- •Qwen3-30B-A3B-FP8-FlashAttn 最慢:288.9 秒,輸出 270.9 tok/s
- •設定:15 個提示,223k 輸入/78k 輸出 token,tensor-parallel=2,gpu-memory-util=0.8
- •最高並發:35B AWQ-4bit 達 45,30B AWQ-4bit 約 13.8
- •最佳預填充速度因較低 KV 快取使用而有利 Qwen3.5
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
🛠️ 技術深入
- •架構設計:混合架構結合線性注意力機制與稀疏混合專家模型(MoE),相比密集模型實現更高推理效率[2]
- •上下文窗口:262,144 token的超長上下文支援,支援Flash Infer和Flash Attention等優化注意力機制[2][5]
- •多模態能力:原生視覺語言模型,支援文本、圖像和視頻輸入,輸出為文本格式[2]
- •推理優化:支援推理模式(Reasoning Mode),可展示模型的逐步思考過程,通過web搜索、web提取器和代碼解釋器等工具在複雜問題上實現更高準確度[4][5]
- •量化支援:提供多種GGUF格式(2至16位元),可在Hugging Face上獲取,支援AWQ 4位元量化等多種量化方案[3]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2025-09-23
Qwen3-Max模型快照發布,支援思考模式與非思考模式
2025-12-01
Qwen3.5-Plus穩定版本發布,支援文本、圖像和視頻輸入
2026-01-23
Qwen3-Max 2026-01-23思考模式快照發布,整合web搜索、web提取器和代碼解釋器工具
2026-02-15
Qwen3.5-Plus 2026-02-15版本發布,預設啟用思考模式
2026-02-24
Qwen3.5系列正式發布,包含Qwen3.5-122B-A10B、Qwen3.5-35B-A3B和Qwen3.5-27B三個主要變體
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。