
Gemma 4 原有隱藏 MTP 被移除以確保相容性
Gemma 4 模型在 LiteRT 檔案中包含用於推測解碼的 MTP 權重,但 Google 故意移除以確保更廣泛的相容性。一名 Google 員工在 Pixel 9 上出現錯誤後確認此事。社群呼籲發布完整模型或反向工程。
Tag: #speculative-decoding32 results

Gemma 4 模型在 LiteRT 檔案中包含用於推測解碼的 MTP 權重,但 Google 故意移除以確保更廣泛的相容性。一名 Google 員工在 Pixel 9 上出現錯誤後確認此事。社群呼籲發布完整模型或反向工程。

一名 LocalLLaMA 使用者分享了在 32GB Tesla V100 PCIe GPU 上,透過 llama.cpp 執行 Qwen3.6 27B 的設定,支援 128K 上下文與推測解碼。這篇文章主要是設定與效能交流請求,文字中提供了詳細參數,但沒有列出數值化的基準測試結果。