
Google 發布 Gemma 4 的 MTP,文字生成速度提升最高 3 倍
Google 為其開源模型 Gemma 4 發布多標記預測草稿器(MTP),文字生成速度提升最高 3 倍。它採用投機性解碼來並行化推論,同時維持生成品質。此工具支援主要推論框架,並適用於邊緣至雲端環境。
Tag: #speculative-decoding32 results

Google 為其開源模型 Gemma 4 發布多標記預測草稿器(MTP),文字生成速度提升最高 3 倍。它採用投機性解碼來並行化推論,同時維持生成品質。此工具支援主要推論框架,並適用於邊緣至雲端環境。

Google 使用 MTP Drafters 讓 Gemma 4 模型速度提升 3 倍。這採用推測解碼,將重型主模型與輕量級草稿模型配對預先生成權重。模型現可在消費級 GPU 與邊緣裝置高效運行。

Google 的 Gemma 4 開放 AI 模型採用 speculative decoding,實現高達 3 倍推論速度。此技術在不損失輸出品質下提供效能提升。報導質疑此說法是否好得令人難以置信。
使用者在 RTX 2080 SUPER 8GB VRAM 上透過 llama.cpp 實現 Qwen3.5-35B-A3B 的 DFlash 推測解碼,結合 MoE CPU 卸載。速度從 26.8 tok/s 提升至 35.6 tok/s,獲 33% 加速。最適 draft-max 為 6,接受率 99%。

Luce DFlash 是 DFlash 推測解碼的 GGUF 移植版,針對 Qwen3.6-27B,在單張 RTX 3090 上實現高達 2 倍吞吐量,使用基於 ggml 的獨立 C++/CUDA 堆疊。支援 256K 上下文,具 KV 快取壓縮與滑動視窗注意力,在程式碼/數學任務上基準測試達 1.98 倍平均加速。部署簡單,只需 CMake 建置與 Hugging Face 下載,並提供 OpenAI 相容伺服。

RL 後訓練中的滾動是主要瓶頸。Together AI 的分布感知推測解碼 (DAS) 使用自適應推測解碼,將滾動加速高達 50%。獎勵品質零衰減。

使用者實驗顯示,使用 llamacpp 的推測解碼,Qwen-3.6-27B 推論速度從 13.6 t/s 提升至 136.75 t/s。模型迭代生成水族箱程式的完整程式碼、修復錯誤並新增功能。在具 40GB VRAM 的硬體上實現,並需更新 llama.cpp。
llama.cpp 透過 PR #19493 合併推測檢查點功能。有些提示可加速,視任務而定;程式碼任務使用特定參數可獲 0-50% 提升。效能取決於草稿接受率與重複模式。

了解推測解碼如何在 AWS Trainium2 上加速解碼密集型 LLM 推論。透過 vLLM 整合降低每產生權重的成本。本文解釋技術原理與優勢。