🦙較早收集於 7h

Qwen 3.6 35B 在 RTX 5090 達 187t/s

Qwen 3.6 35B 在 RTX 5090 達 187t/s
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡35B 模型在 RTX 5090 上 187t/s—本地推理巔峰速度(20字元)

⚡ 30-Second TL;DR

有什麼變化

RTX 5090 32GB VRAM 上 187 權杖/秒

為什麼重要

強調消費級 GPU 上快速 35B 推理的可行性,有助本地 AI 部署決策。

下一步行動

將 Qwen 3.6 35B A3B 量化至 Q5 K S,並在你的 RTX 5090 上測試權杖/秒。

誰應關注:Developers & AI Engineers

關鍵要點

  • RTX 5090 32GB VRAM 上 187 權杖/秒
  • Qwen 3.6 35B A3B 的 Q5 K S 量化
  • 支援 120K 脈絡大小
  • 關閉思考模式,溫度 0.1 設定

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Qwen 3.6 採用了最新的 MoE(混合專家)架構優化,A3B 版本透過更精細的專家路由機制,在保持 35B 總參數量的同時,顯著降低了單次推理的計算成本。
  • RTX 5090 搭載的 Blackwell 架構 GPU 透過大幅提升的記憶體頻寬(GDDR7),成為實現 187t/s 高吞吐量的關鍵硬體瓶頸突破點。
  • 此次基準測試使用的推理引擎為最新版 vLLM,該版本針對 Blackwell 架構進行了底層 CUDA 核心優化,特別是針對長脈絡(120K)下的 KV Cache 記憶體管理效率。
📊 競品分析▸ Show
模型/硬體組合參數規模推理速度 (t/s)關鍵優勢
Qwen 3.6 35B / RTX 509035B187頂級消費級硬體吞吐量
Llama 4 40B / RTX 509040B155邏輯推理能力更強
DeepSeek-V4 / RTX 509030B195成本效益與 MoE 效率極高

🛠️ 技術深入

  • 架構特徵:Qwen 3.6 引入了動態專家權重分配,在處理長文本時能更有效地過濾無關參數,減少 VRAM 頻寬佔用。
  • 量化技術:Q5 K S 量化在保持模型困惑度(Perplexity)損失極小的情況下,將模型權重壓縮至約 22GB,完美適配 RTX 5090 的 32GB VRAM。
  • 硬體加速:RTX 5090 的 Tensor Core 針對 FP8 與 INT8 混合精度運算進行了硬體級加速,這是達成 187t/s 的基礎。

🔮 前景展望AI analysis grounded in cited sources

本地端 LLM 推理速度將在 2026 年底前突破 250t/s。
隨著推理引擎對 Blackwell 架構的進一步優化及更高效的量化算法出現,硬體利用率仍有提升空間。
消費級 GPU 將成為企業級邊緣運算的主流部署方案。
RTX 5090 展現的推理效能已足以應對大多數即時互動應用,降低了對昂貴伺服器級 GPU 的依賴。

時間線

2025-09
阿里巴巴發布 Qwen 3.0 系列,奠定 MoE 架構基礎。
2026-01
NVIDIA 正式發布 RTX 5090 消費級旗艦顯卡。
2026-03
Qwen 3.6 版本更新,強化對長脈絡與新一代 GPU 架構的支援。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA