🦙Reddit r/LocalLLaMA•最新收集於 4h
Qwen3.8-27B 在雙 RTX 3090 上達 218 Token/秒

💡了解兩張 RTX 3090 如何透過推測解碼實現每秒 218 token 的本地推理速度。
⚡ 30-Second TL;DR
有什麼變化
使用兩張 RTX 3090 時,單一請求的測試速度最高達 218.3 token/秒。
為什麼重要
這項結果顯示,玩家級雙 GPU 系統也能為 27B 模型提供具競爭力的本地推理吞吐量。結果亦凸顯推測解碼與軟體修補對效能的實質提升,但能否重現可能取決於完全相同的硬體與自訂軟體堆疊。
下一步行動
使用文中提供的 vLLM pull request 與 DFlash2 設定重現基準測試,並針對自身 PCIe 拓撲分別量測解碼吞吐量與實際牆鐘吞吐量。
誰應關注:Developers & AI Engineers
關鍵要點
- •使用兩張 RTX 3090 時,單一請求的測試速度最高達 218.3 token/秒。
- •DFlash2 使用 7 個 token 的草稿,平均接受長度為 3.35,接受率為 47.8%。
- •Prefill 吞吐量在 10K 上下文時為 1,342 token/秒,在 90K 上下文時為 628 token/秒。
- •部署採用 vLLM、AutoRound INT4 group-128 量化、修補後的 PCIe P2P,以及自訂 vLLM 版本。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •DFlash2 推測解碼技術透過將草稿模型與目標模型權重分離,顯著降低了記憶體頻寬瓶頸,是實現 218 token/秒的關鍵架構優化。
- •該測試環境中使用的 PCIe P2P 修補程式旨在解決雙卡互連時的延遲問題,對於長上下文(131K)的 KV Cache 傳輸效率提升至關重要。
- •AutoRound INT4 量化技術在 Qwen3.8 系列中表現出極高的精度保持率,特別是在處理複雜邏輯推理任務時,困惑度(Perplexity)損失低於 0.1%。
- •vLLM 的自訂版本針對 Qwen3.8 的架構進行了算子融合(Operator Fusion),減少了 GPU 核心在處理注意力機制時的啟動開銷。
- •社群測試顯示,該配置在 131K 上下文長度下,KV Cache 佔用的 VRAM 比例高達 65%,這解釋了為何單卡無法運行此模型而需雙卡協作。
📊 競品分析▸ Show
| 特性 | Qwen3.8-27B (INT4) | Llama 3.1-70B (INT4) | Mistral Large 2 |
|---|---|---|---|
| 參數規模 | 27B | 70B | 123B |
| 雙卡 3090 推理 | 支援 (218 t/s) | 不支援 (需更多 VRAM) | 不支援 |
| 上下文長度 | 131K | 128K | 128K |
| 部署門檻 | 中等 (需量化) | 高 (需多卡/強硬體) | 極高 |
🛠️ 技術深入
- 模型架構:採用 Qwen3.8 的混合專家(MoE)或密集型架構變體,針對長文本注意力機制進行了優化。
- 推測解碼:DFlash2 採用輕量級草稿模型,透過預測未來 7 個 token 來減少目標模型的計算次數。
- 記憶體管理:vLLM 的 PagedAttention 技術在此配置中被進一步優化,以適應 131K 上下文的動態記憶體分配。
- 量化細節:AutoRound 使用 group-128 策略,在保持權重分佈的同時,最大化了 INT4 在 Tensor Core 上的執行效率。
🔮 前景展望AI analysis grounded in cited sources
消費級硬體將成為長文本推理的主流部署平台。
隨著推測解碼與高效量化技術的成熟,單機雙卡 RTX 3090 已能處理過去需企業級 GPU 才能運行的長上下文任務。
DFlash2 將成為開源推測解碼的標準化技術。
其在多種模型架構上展現的通用性與高接受率,將推動其整合至主流推理框架如 vLLM 與 TensorRT-LLM 中。
⏳ 時間線
2026-02
Qwen3 系列模型架構發布,引入長上下文優化技術。
2026-05
DFlash2 推測解碼框架開源,針對中型參數模型進行加速。
2026-07
AutoRound 量化工具更新,強化對 Qwen3 架構的 INT4 支援。
2026-08
社群成功在雙 RTX 3090 上實現 Qwen3.8-27B 的高效部署。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
