🦙Reddit r/LocalLLaMA•最新收集於 13h
DFlash2 在 RTX 3090 達到 138 TPS
💡了解軟體最佳化如何讓 Qwen3.8-27B 在 250W RTX 3090 上達到 138 TPS。
⚡ 30-Second TL;DR
有什麼變化
在功耗限制為 250 瓦的 RTX 3090 上,單使用者速度提升至約 138 TPS。
為什麼重要
這項更新顯示,透過精細的量化、推測解碼與快取管理,即使不升級硬體,也能大幅提升本地推論效能。對使用消費級 GPU 執行長上下文工作負載的團隊尤其具參考價值。
下一步行動
在你的 RTX 3090 上使用 DFlash2 與 vLLM 0.27.1 對 Qwen3.8-27B 進行基準測試,並比較啟用與停用 mamba 前綴快取時的延遲。
誰應關注:Developers & AI Engineers
關鍵要點
- •在功耗限制為 250 瓦的 RTX 3090 上,單使用者速度提升至約 138 TPS。
- •DFlash2 將推測解碼效率從每步 2.8 個 token 提升至 3.3 個。
- •查找增強式草稿功能,在重複內容工作負載中將每步 token 數提升最多 29%。
- •混合模型的前綴快取,將 24k token 文件的後續回合延遲從 23 秒降至 0.85–1.35 秒。
- •透過額外的配置器修正,該推論堆疊支援 64k 上下文。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。