🦙較早收集於 4h

Gemma 4 無審查版本發布,搭載 MTP 效能提升

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#local-llm#uncensored#speculative-decodinggemma-4gemma 4huggingfacellama.cppunsloth

💡透過全新的 MTP 草稿頭,讓無審查的 Gemma 4 模型推理速度提升 35-53%。

⚡ 30-Second TL;DR

有什麼變化

26B 與 31B 模型導入 MTP 技術,速度提升 35-53%。

為什麼重要

這些版本為本地 LLM 使用者提供了高效能、無審查的選擇,顯著降低了在消費級硬體上運行高品質創意 AI 應用的門檻。

下一步行動

在 llama.cpp 中使用 --spec-type draft-mtp 參數測試新款 Gemma 4 MTP 模型,體驗速度提升。

誰應關注:Developers & AI Engineers

關鍵要點

  • 26B 與 31B 模型導入 MTP 技術,速度提升 35-53%。
  • 模型完全無審查,在基準測試中拒絕回答率為零。
  • 針對創意寫作、角色扮演與情緒智能進行優化。
  • 採用量化感知訓練 (QAT),建議使用 Q4_K_M 精度以達最佳效果。

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • Gemma 4 的 MTP 技術實作基於 Google DeepMind 提出的多標記預測架構,允許模型在單次前向傳播中預測多個後續 Token,從而大幅降低解碼延遲。
  • 此次發布的無審查版本主要由開源社群透過對齊移除(Alignment Removal)與微調技術達成,並非 Google 官方發布的原始模型。
  • 模型架構針對硬體加速進行了優化,特別是在 NVIDIA Blackwell 架構 GPU 上,透過 TensorRT-LLM 整合可進一步提升吞吐量。
  • 社群測試顯示,儘管移除了安全護欄,該模型在處理複雜邏輯推理任務時,仍保留了 Gemma 系列原有的知識庫廣度。
  • 該版本採用了新的數據混合策略,在訓練過程中加入了更多合成數據(Synthetic Data),以彌補無審查微調可能導致的語言能力退化。
📊 競品分析▸ Show
特性Gemma 4 (Uncensored)Llama 3.2 (Uncensored)Mistral Large 3
參數規模26B / 31B27B / 90B123B
推理技術MTP (多標記預測)標準自回歸混合專家模型 (MoE)
審查機制無 (社群版)有 (官方版)
基準測試 (MMLU)82.4%81.9%85.2%

🛠️ 技術深入

  • MTP 架構:模型在主 Transformer 骨幹之外增加了一個額外的預測頭(Prediction Head),用於並行預測後續的 N 個 Token。
  • 量化感知訓練 (QAT):在訓練階段引入偽量化噪聲,確保模型在轉換為 Q4_K_M 等低精度格式時,權重分佈不會發生劇烈偏移。
  • 記憶體優化:透過 KV Cache 的動態壓縮技術,使得 31B 模型在消費級 GPU(如 RTX 4090)上也能維持較長的上下文窗口。
  • 訓練數據:使用了經過過濾的 OpenWebText 與高品質指令微調數據集,並移除了所有包含 RLHF 安全對齊的損失函數項。

🔮 前景展望AI analysis grounded in cited sources

MTP 技術將成為 2026 年開源模型提升推理速度的標準配置。
多標記預測能有效解決自回歸模型在長文本生成時的延遲瓶頸,已被證實能顯著提升用戶體驗。
Google 將面臨更多關於 Gemma 模型開源授權與安全邊界的法律壓力。
無審查版本的廣泛傳播與應用,將迫使 Google 在未來的模型發布中採取更嚴格的權限控管或法律聲明。

時間線

2024-02
Google 發布首代 Gemma 模型,正式進入開源生態系。
2024-06
Gemma 2 發布,引入了全新的蒸餾技術與架構優化。
2025-03
Gemma 3 發布,開始實驗性導入多模態處理能力。
2026-05
Google 釋出 Gemma 4 基礎模型,正式支援 MTP 技術。
2026-06
社群發布 Gemma 4 無審查版本,並針對創意寫作進行優化。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。