DFlash2 在 RTX 3090 達到 138 TPS
一套搭載 DFlash2 的高度最佳化 Qwen3.8-27B 推論堆疊,在受限功耗的 RTX 3090 上達到約每秒 138 個 token,64 個請求的吞吐量則達到 942 TPS。前綴快取也將長對話後續回合的延遲,從約 23 秒降至 1.4 秒以下。
Tag: #speculative-decoding32 results
一套搭載 DFlash2 的高度最佳化 Qwen3.8-27B 推論堆疊,在受限功耗的 RTX 3090 上達到約每秒 138 個 token,64 個請求的吞吐量則達到 942 TPS。前綴快取也將長對話後續回合的延遲,從約 23 秒降至 1.4 秒以下。

社群基準測試顯示,Qwen3.8-27B 在兩張 RTX 3090 上搭配 vLLM、INT4 量化與 DFlash2 推測解碼,最高可達每秒 218.3 token。該配置支援最高 131K 上下文,首 token 延遲約 168–178 毫秒,每張顯示卡峰值 VRAM 使用量為 22.3 GB。

一項 llama.cpp 拉取請求提案加入自適應多 Token 預測,可在生成過程中動態選擇 MTP 深度。作者表示,該功能在難以預測的散文上略有退步,但在程式碼生成與回憶先前上下文內容時有顯著提升。

一名 Reddit 使用者表示,透過 llama.cpp,他在 RTX 5060 Ti 16GB 上讓 Qwen3.8-27B 執行 73,728-token 的上下文視窗。在代理式程式設計測試中,模型處理超過 100 萬個 tokens,僅用三個提示就完成了可運作的 REST API 與 MCP Server。

DeepSeek 發布了 DSpark 技術報告與程式碼庫,為 V4 模型引入了推測解碼模組。此更新在無需更換底座模型的情況下,顯著提升了推理速度。

JetSpec 引入了一種用於推測解碼的平行樹狀草擬方法,在 LLM 推論上實現了高達 9.64 倍的速度提升。它在保持無損生成品質的同時,於單張 B200 GPU 上達到了每秒 1000 個 Token 的速度。

DeepSeek 發布了採用 MIT 授權的 DSpark,這是一個旨在顯著提升 LLM 推論速度的投機解碼框架。該系統利用「偵察」模型預測標記路徑,在不影響輸出品質的前提下加速生成。

中國 AI 新創公司 DeepSeek 推出了名為 DSpark 的推測解碼框架,旨在加速其 V4 模型的反應生成速度。此更新旨在減少推論瓶頸並降低 AI 系統的服務成本。

北京大學與 DeepSeek 共同發布了 DSpark,這是一個旨在顯著提升大型語言模型(LLM)推論效能的推測解碼框架。該框架在嚴格的延遲限制下,實現了顯著的速度提升與吞吐量增加。
新版 Gemma 4 (26B 與 31B) 無審查模型現已發布,透過多標記預測 (MTP) 技術顯著提升推理速度。這些模型針對創意寫作與角色扮演進行了優化,移除了拒絕回答的機制。