🦙最新收集於 13h

DFlash2 在 RTX 3090 達到 138 TPS

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡了解軟體最佳化如何讓 Qwen3.8-27B 在 250W RTX 3090 上達到 138 TPS。

⚡ 30-Second TL;DR

有什麼變化

在功耗限制為 250 瓦的 RTX 3090 上,單使用者速度提升至約 138 TPS。

為什麼重要

這項更新顯示,透過精細的量化、推測解碼與快取管理,即使不升級硬體,也能大幅提升本地推論效能。對使用消費級 GPU 執行長上下文工作負載的團隊尤其具參考價值。

下一步行動

在你的 RTX 3090 上使用 DFlash2 與 vLLM 0.27.1 對 Qwen3.8-27B 進行基準測試,並比較啟用與停用 mamba 前綴快取時的延遲。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在功耗限制為 250 瓦的 RTX 3090 上,單使用者速度提升至約 138 TPS。
  • DFlash2 將推測解碼效率從每步 2.8 個 token 提升至 3.3 個。
  • 查找增強式草稿功能,在重複內容工作負載中將每步 token 數提升最多 29%。
  • 混合模型的前綴快取,將 24k token 文件的後續回合延遲從 23 秒降至 0.85–1.35 秒。
  • 透過額外的配置器修正,該推論堆疊支援 64k 上下文。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。