
Gemma 4 31B 推測解碼平均加速 29%
使用 Gemma 4 E2B 草稿模型的推測解碼,讓 Gemma 4 31B 推理速度平均提升 29%,程式碼生成達 50%。關鍵問題是 GGUF 元數據不匹配導致權重翻譯開銷。結構化任務如數學和程式碼有高接受率。
Tag: #speculative-decoding32 results

使用 Gemma 4 E2B 草稿模型的推測解碼,讓 Gemma 4 31B 推理速度平均提升 29%,程式碼生成達 50%。關鍵問題是 GGUF 元數據不匹配導致權重翻譯開銷。結構化任務如數學和程式碼有高接受率。

DFlash 推測解碼的原生 MLX 實作,在 M5 Max 上為 Qwen3.5-9B 帶來 3.3 倍加速。基準測試顯示各模型大小與量化皆有顯著提升。開發者分享優化技巧與未來計畫,包括開源。

Aurora 是 Together AI 的開源 RL 框架,將推測解碼從靜態離線設定轉變為持續學習系統。它比訓練良好的靜態推測器快 1.25 倍。該框架透過服務的每個請求來自我改善。

PyTorch 推出 TorchSpec,這是一款用於大規模訓練推測解碼的新系統,隨著大型語言模型的快速成長而應運而生。邊緣模型如 Kimi K2.5、GLM 5 和 Qwen 3.5 突顯了高效訓練技術的需求。TorchSpec 旨在有效支援這些巨型模型。

Hugging Face 推出 SPEED-Bench,這是一個用於評估語言模型推測解碼技術的統一且多樣基準。它標準化了各種方法的測試,以衡量加速與準確度。此工具幫助研究人員有效比較推測解碼方法。

P-EAGLE 在 vLLM 中引入並行推測解碼,以加速 LLM 推理。從 v0.16.0 版本起透過 PR#32887 整合。預訓練檢查點可輕鬆部署優化模型。
llama.cpp 的一個 Pull Request 將多 Token 預測(MTP)使用者的取樣工作從 CPU 移至 GPU。貢獻者表示,搭配 Qwen3.6-35B 時,RTX 5090 約提升 8%,Tesla P40 約提升 4%,且接受率維持不變。
使用者在 Devstral small 以 llama.cpp 推測解碼獲 665% 加速 (--spec-type ngram-map-k, ngram-size 24)。依模型而異:Gemma 2 倍、Qwen 3.6 初僅 40%,調整後達 140%。編輯新增重複懲罰與 ngram-mod 改善。

oMLX 0.3.5 RC1 新增 DFlash 支援,讓 Mac M5 Max 128GB 上 Qwen3.5-27B BF16 生成速度從 9 翻倍至 22 t/s。使用特定 HF 主模型與草稿模型。提供 DFlash GitHub 與 oMLX 網站連結。

DFlash 引入區塊擴散技術,用於閃存推測解碼,提升效率。專案包含 GitHub 程式碼與 Hugging Face 模型。在 Reddit r/LocalLLaMA 上分享連結。