🦙較早收集於 6h

Unsloth 發布 Gemma 4 QAT MTP 助理模型

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡獲取高度優化的 GGUF 格式 Gemma 4 模型,實現高效的本機部署。

⚡ 30-Second TL;DR

有什麼變化

提供 GGUF 格式的全新 Gemma 4 助理模型

為什麼重要

這些量化模型讓開發者能在消費級硬體上執行高效能的 Gemma 4 變體,並降低記憶體佔用。

下一步行動

從 Unsloth 的 Hugging Face 儲存庫下載相關的 GGUF 檔案,以在您的本機機器上測試 Gemma 4 的效能。

誰應關注:Researchers & Academics

關鍵要點

  • 提供 GGUF 格式的全新 Gemma 4 助理模型
  • 利用 QAT 與 MTP 技術優化效能
  • 提供多種尺寸,包含 12B、26B、31B 及 E 系列

🧠 深度解析

Web-grounded analysis with 28 cited sources.

🔑 增強重點摘要

  • Unsloth 的量化感知訓練(QAT)技術與 PyTorch 的 TorchAO 合作開發,能夠恢復高達 70% 因量化造成的精度損失,並在 GPQA 和 MMLU Pro 等基準測試中實現 1-3% 的性能提升,且不增加推論時的額外開銷或磁碟/記憶體使用量。
  • 多令牌預測(MTP)技術透過讓模型一次預測多個即將到來的令牌來加速推論,隨後由主模型平行驗證這些令牌,從而減少生成所需的正向傳遞次數,在不損失準確性的情況下加快輸出速度。
  • Unsloth 針對 Google 的 QAT 權重應用其「Dynamic 2.0」方法,特別優化 GGUF 轉換。他們發現直接將 QAT 檢查點轉換為 Q4_0 GGUF 會降低準確性,因此其動態處理旨在提高與真實 BF16 QAT 權重的一致性,從而產生更小、更準確的 GGUF 模型。
  • 底層的 Gemma 4 模型是多模態的(處理文字、圖像和部分音訊輸入),支援高達 256K 的上下文長度,並採用混合注意力機制(交錯局部滑動窗口注意力與全局注意力)以及平行密集加專家混合(MoE)前饋設計。
  • Unsloth 透過在 Triton 中客製化注意力實作、智慧型權重升級、更好地利用 bfloat16、因果注意力遮罩以及手動優化 MLP 和自注意力模組的梯度計算,實現了 2-5 倍的訓練速度提升和 60-90% 的 VRAM 減少。
📊 競品分析▸ Show
特性/價格/基準測試UnslothAxolotlTorchtuneLLaMA Factory
主要功能快速微調 (2-30x), 低 VRAM (60-90% 少), 支援 LoRA/QLoRA, QAT, MTP, GRPO, MoE 加速, 客製化核心, GGUF 轉換, 多 GPU (Pro/Enterprise)易於上手, YAML 配置, 支援全微調與適配器 (LoRA/QLoRA), 多 GPU 訓練, 多模態支援 (LLaMA-Vision, Qwen2-VL, Pixtral)PyTorch 原生, 適合直接使用 PyTorch 的開發者完整微調工具包, 零程式碼微調 (Web UI), 使用 Unsloth 作為加速後端 (2-5x 速度提升)
定價模式免費 (開源版, 2x 速度, 60% VRAM 減少, 單 GPU); Pro/Enterprise (聯絡報價, 更高速度, 更多 VRAM 減少, 多 GPU/節點支援)開源 (免費)開源 (免費)開源 (免費)
基準測試A100 80GB 上 70B 模型 QLoRA 微調 4.2 小時;H100 80GB 上 2.8 小時;MoE Qwen3 30B-A3B 微調快 12 倍,佔用 17.5GB VRAM;QAT 恢復 69% 精度損失A100 80GB 上 70B 模型微調 6.1 小時 (多 GPU 擴展性佳);Llama-3.1 13B 全微調 16 小時 (A100 80GB);8x H100 上 Llama-3.1 70B 全微調 18 小時缺乏明確的公開基準測試數據RTX 4090 上 7B 模型微調比原生 Axolotl 快 2.1 倍 (使用 Unsloth 後端)

🛠️ 技術深入

  • 量化感知訓練 (QAT):
    • 將量化過程直接整合到訓練管線中,在微調期間模擬低位元錯誤。
    • 模型學習調整權重以補償捨入誤差,從而比訓練後量化 (PTQ) 實現更高的準確性。
    • Unsloth 的 QAT 利用 PyTorch 的 TorchAO 函式庫,在線性層中插入「假量化」模組。權重被捨入為量化等效值(例如 4 位元整數),然後立即去量化回高精度以進行梯度計算。
    • 支援多種方案:int4、fp8-int4、int8-int4 和完整的 fp8-fp8。
    • 可與 LoRA 微調結合使用。
    • Gemma 4 QAT 模型可減少約 72% 的記憶體使用量,同時保持接近原始的準確性。
  • 多令牌預測 (MTP):
    • 透過讓模型一次預測多個即將到來的令牌來加速推論,而不是每一步生成一個令牌。
    • 主模型隨後平行驗證這些預測的令牌。
    • 減少生成所需的正向傳遞次數,在不損失準確性的情況下加快輸出速度,因為只保留經過驗證的令牌。
    • 在 GPU 上特別有效。
  • GGUF 格式:
    • 一種用於儲存和分發 LLM 的格式,針對 llama.cpp 的 CPU 推論進行了優化。
    • 實現跨各種平台的高效部署,並顯著減少模型大小,同時保持性能,使本地部署在消費級硬體上可行。
    • Unsloth 的 Dynamic 2.0 量化方法專門優化 GGUF 轉換,更智慧、更廣泛地選擇性量化層,並使用高品質校準數據集來增強對話式聊天性能。
  • Unsloth 的核心優化 (超越 QAT/MTP):
    • 在 Triton 中客製化注意力實作(OpenAI 的 GPU 核心高階語言),實現 2-5 倍的訓練速度和 80% 更少的記憶體使用。
    • 智慧型權重升級(僅對必要層升級到 float32)。
    • 更好地利用 bfloat16 以避免不必要的轉換。
    • 用於因果 LLM 任務的因果注意力遮罩。
    • 手動優化 MLP 和自注意力模組的梯度計算,以及記憶體效率高的交叉熵損失。
    • 融合 QK 旋轉位置嵌入 (RoPE) Triton 核心,支援打包,並更新 SwiGLU、GeGLU 核心,支援長上下文的 int64 索引。
    • 無填充、無污染打包,可實現 2.5 倍至 5 倍的訓練速度提升,同時減少 30-90% 的 VRAM 使用。
  • Gemma 4 架構 (簡要):
    • 多模態(文字、圖像、部分音訊)。
    • 上下文窗口長度高達 256K 令牌。
    • 混合注意力機制:交錯局部滑動窗口注意力與完整的全局注意力。
    • 平行密集加專家混合 (MoE) 前饋設計。
    • 俄羅斯套娃式嵌套模型結構,帶有每層嵌入 (MatFormer + PLE),允許較小的子模型結構性地包含在較大的模型中。

🔮 前景展望AI analysis grounded in cited sources

邊緣設備上的高效能大型語言模型部署將加速普及。
Unsloth 結合 QAT 與 MTP 技術,顯著降低 Gemma 4 模型對記憶體和計算資源的需求,使其能在消費級 GPU、筆記型電腦甚至行動裝置上運行,從而擴大 LLM 的應用範圍。
Unsloth 將鞏固其作為高效能 LLM 微調和部署解決方案領導者的地位。
透過持續與 Google 等主要模型開發者合作,並提供優於其他量化方法的性能和準確性,Unsloth 吸引更多開發者採用其平台。
LLM 開發者將更傾向於採用量化感知訓練(QAT)而非傳統的訓練後量化(PTQ)。
QAT 在大幅壓縮模型尺寸的同時能顯著恢復甚至提升模型準確度,解決了 PTQ 在低位元量化時的性能下降問題,使其成為資源受限環境下的首選。

時間線

2023
Unsloth AI 成立,專注於加速大型語言模型(LLM)的微調。
2024-02
Google 發布 Gemma 1 系列模型。
2024-09
Unsloth AI 獲得 50 萬美元種子輪融資。
2025-10
Unsloth 推出與 PyTorch 合作的 QAT 實作,顯著提升量化模型精度。
2026-04
Google 發布 Gemma 4 系列模型。
2026-06-09
Unsloth 發布 Gemma 4 QAT MTP 助理模型,提供 GGUF 格式下載。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA