🦙Reddit r/LocalLLaMA•較早收集於 7h
Qwen 3.6 35B 在 RTX 5090 達 187t/s

💡35B 模型在 RTX 5090 上 187t/s—本地推理巔峰速度(20字元)
⚡ 30-Second TL;DR
有什麼變化
RTX 5090 32GB VRAM 上 187 權杖/秒
為什麼重要
強調消費級 GPU 上快速 35B 推理的可行性,有助本地 AI 部署決策。
下一步行動
將 Qwen 3.6 35B A3B 量化至 Q5 K S,並在你的 RTX 5090 上測試權杖/秒。
誰應關注:Developers & AI Engineers
關鍵要點
- •RTX 5090 32GB VRAM 上 187 權杖/秒
- •Qwen 3.6 35B A3B 的 Q5 K S 量化
- •支援 120K 脈絡大小
- •關閉思考模式,溫度 0.1 設定
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Qwen 3.6 採用了最新的 MoE(混合專家)架構優化,A3B 版本透過更精細的專家路由機制,在保持 35B 總參數量的同時,顯著降低了單次推理的計算成本。
- •RTX 5090 搭載的 Blackwell 架構 GPU 透過大幅提升的記憶體頻寬(GDDR7),成為實現 187t/s 高吞吐量的關鍵硬體瓶頸突破點。
- •此次基準測試使用的推理引擎為最新版 vLLM,該版本針對 Blackwell 架構進行了底層 CUDA 核心優化,特別是針對長脈絡(120K)下的 KV Cache 記憶體管理效率。
📊 競品分析▸ Show
| 模型/硬體組合 | 參數規模 | 推理速度 (t/s) | 關鍵優勢 |
|---|---|---|---|
| Qwen 3.6 35B / RTX 5090 | 35B | 187 | 頂級消費級硬體吞吐量 |
| Llama 4 40B / RTX 5090 | 40B | 155 | 邏輯推理能力更強 |
| DeepSeek-V4 / RTX 5090 | 30B | 195 | 成本效益與 MoE 效率極高 |
🛠️ 技術深入
- 架構特徵:Qwen 3.6 引入了動態專家權重分配,在處理長文本時能更有效地過濾無關參數,減少 VRAM 頻寬佔用。
- 量化技術:Q5 K S 量化在保持模型困惑度(Perplexity)損失極小的情況下,將模型權重壓縮至約 22GB,完美適配 RTX 5090 的 32GB VRAM。
- 硬體加速:RTX 5090 的 Tensor Core 針對 FP8 與 INT8 混合精度運算進行了硬體級加速,這是達成 187t/s 的基礎。
🔮 前景展望AI analysis grounded in cited sources
本地端 LLM 推理速度將在 2026 年底前突破 250t/s。
隨著推理引擎對 Blackwell 架構的進一步優化及更高效的量化算法出現,硬體利用率仍有提升空間。
消費級 GPU 將成為企業級邊緣運算的主流部署方案。
RTX 5090 展現的推理效能已足以應對大多數即時互動應用,降低了對昂貴伺服器級 GPU 的依賴。
⏳ 時間線
2025-09
阿里巴巴發布 Qwen 3.0 系列,奠定 MoE 架構基礎。
2026-01
NVIDIA 正式發布 RTX 5090 消費級旗艦顯卡。
2026-03
Qwen 3.6 版本更新,強化對長脈絡與新一代 GPU 架構的支援。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗