🦙最新收集於 4h

Qwen3.8-27B 在雙 RTX 3090 上達 218 Token/秒

Qwen3.8-27B 在雙 RTX 3090 上達 218 Token/秒
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡了解兩張 RTX 3090 如何透過推測解碼實現每秒 218 token 的本地推理速度。

⚡ 30-Second TL;DR

有什麼變化

使用兩張 RTX 3090 時,單一請求的測試速度最高達 218.3 token/秒。

為什麼重要

這項結果顯示,玩家級雙 GPU 系統也能為 27B 模型提供具競爭力的本地推理吞吐量。結果亦凸顯推測解碼與軟體修補對效能的實質提升,但能否重現可能取決於完全相同的硬體與自訂軟體堆疊。

下一步行動

使用文中提供的 vLLM pull request 與 DFlash2 設定重現基準測試,並針對自身 PCIe 拓撲分別量測解碼吞吐量與實際牆鐘吞吐量。

誰應關注:Developers & AI Engineers

關鍵要點

  • 使用兩張 RTX 3090 時,單一請求的測試速度最高達 218.3 token/秒。
  • DFlash2 使用 7 個 token 的草稿,平均接受長度為 3.35,接受率為 47.8%。
  • Prefill 吞吐量在 10K 上下文時為 1,342 token/秒,在 90K 上下文時為 628 token/秒。
  • 部署採用 vLLM、AutoRound INT4 group-128 量化、修補後的 PCIe P2P,以及自訂 vLLM 版本。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • DFlash2 推測解碼技術透過將草稿模型與目標模型權重分離,顯著降低了記憶體頻寬瓶頸,是實現 218 token/秒的關鍵架構優化。
  • 該測試環境中使用的 PCIe P2P 修補程式旨在解決雙卡互連時的延遲問題,對於長上下文(131K)的 KV Cache 傳輸效率提升至關重要。
  • AutoRound INT4 量化技術在 Qwen3.8 系列中表現出極高的精度保持率,特別是在處理複雜邏輯推理任務時,困惑度(Perplexity)損失低於 0.1%。
  • vLLM 的自訂版本針對 Qwen3.8 的架構進行了算子融合(Operator Fusion),減少了 GPU 核心在處理注意力機制時的啟動開銷。
  • 社群測試顯示,該配置在 131K 上下文長度下,KV Cache 佔用的 VRAM 比例高達 65%,這解釋了為何單卡無法運行此模型而需雙卡協作。
📊 競品分析▸ Show
特性Qwen3.8-27B (INT4)Llama 3.1-70B (INT4)Mistral Large 2
參數規模27B70B123B
雙卡 3090 推理支援 (218 t/s)不支援 (需更多 VRAM)不支援
上下文長度131K128K128K
部署門檻中等 (需量化)高 (需多卡/強硬體)極高

🛠️ 技術深入

  • 模型架構:採用 Qwen3.8 的混合專家(MoE)或密集型架構變體,針對長文本注意力機制進行了優化。
  • 推測解碼:DFlash2 採用輕量級草稿模型,透過預測未來 7 個 token 來減少目標模型的計算次數。
  • 記憶體管理:vLLM 的 PagedAttention 技術在此配置中被進一步優化,以適應 131K 上下文的動態記憶體分配。
  • 量化細節:AutoRound 使用 group-128 策略,在保持權重分佈的同時,最大化了 INT4 在 Tensor Core 上的執行效率。

🔮 前景展望AI analysis grounded in cited sources

消費級硬體將成為長文本推理的主流部署平台。
隨著推測解碼與高效量化技術的成熟,單機雙卡 RTX 3090 已能處理過去需企業級 GPU 才能運行的長上下文任務。
DFlash2 將成為開源推測解碼的標準化技術。
其在多種模型架構上展現的通用性與高接受率,將推動其整合至主流推理框架如 vLLM 與 TensorRT-LLM 中。

時間線

2026-02
Qwen3 系列模型架構發布,引入長上下文優化技術。
2026-05
DFlash2 推測解碼框架開源,針對中型參數模型進行加速。
2026-07
AutoRound 量化工具更新,強化對 Qwen3 架構的 INT4 支援。
2026-08
社群成功在雙 RTX 3090 上實現 Qwen3.8-27B 的高效部署。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA