🟩較早收集於 15m

在 NVIDIA 平台上運行 DiffusionGemma 以實現高吞吐量文字生成

在 NVIDIA 平台上運行 DiffusionGemma 以實現高吞吐量文字生成
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog

💡了解如何利用 NVIDIA 上的 DiffusionGemma 優化即時 AI 代理的響應速度並降低服務成本。

⚡ 30-Second TL;DR

有什麼變化

針對 NVIDIA 平台進行高吞吐量文字生成優化

為什麼重要

此發布使開發者能夠構建響應更迅速、流暢的 AI 互動,同時降低與高延遲 token 生成相關的基礎設施成本。

下一步行動

在您現有的 NVIDIA GPU 堆疊上對 DiffusionGemma 進行基準測試,以評估其對您特定代理工作流的延遲改善效果。

誰應關注:Developers & AI Engineers

關鍵要點

  • 針對 NVIDIA 平台進行高吞吐量文字生成優化
  • 旨在降低即時 AI 代理與聊天助理的延遲
  • 解決逐個 token 生成的瓶頸以降低服務成本

🧠 深度解析

Web-grounded analysis with 16 cited sources.

🔑 增強重點摘要

  • DiffusionGemma 的核心創新在於其平行文字生成能力,透過擴散模型從雜訊開始,同時精煉整個文字區塊,這與傳統的逐個 token 生成的自迴歸模型形成鮮明對比,顯著提升了生成速度。
  • 該模型基於 Gemma 4 26B 專家混合 (MoE) 架構,但在推論時僅啟動 3.8 億個參數,使其能夠高效部署於具備 18GB 顯存的消費級 GPU 上。
  • NVIDIA 透過 TensorRT-LLM 和 NVFP4 量化技術進行優化,使文字生成速度提升高達 4 倍,在單一 NVIDIA H100 GPU 上可達每秒 1,000+ 個 token,在 GeForce RTX 5090 上可達每秒 700+ 個 token,尤其適用於單用戶工作負載。
  • 文字擴散模型相較於自迴歸模型,在全局連貫性、動態錯誤修正以及文字編輯或填補等任務上展現出固有優勢,這得益於其雙向上下文建模能力。
  • DiffusionGemma 是一個採用 Apache 2.0 許可證的開源模型,支援在 NVIDIA 的硬體生態系統(包括 RTX GPU、RTX PRO、DGX Spark 和 DGX Station)上進行靈活的本地部署,並與 Hugging Face Transformers 和 vLLM 等主流推論框架提供即時支援。

🛠️ 技術深入

  • 模型架構:DiffusionGemma 基於 Gemma 4 26B 專家混合 (MoE) 架構,但在推論時僅啟動 3.8 億個參數,以提高效率。
  • 生成機制:不同於自迴歸模型依序預測 token,DiffusionGemma 從隨機的佔位符 token「畫布」開始,透過多個去噪步驟平行迭代精煉整個文字區塊。
  • 平行生成:它能同時去噪多達 256 個 token,從而一次性輸出整個文字區塊。
  • 上下文處理:模型利用雙向注意力機制同時評估整個文字區塊,實現即時錯誤修正和平行上下文傳播。
  • 可變長度生成:對於超過 256 個 token 的序列,一旦一個區塊完全去噪,它會被提交到 KV 快取,然後模型處理下一個區塊,此方法稱為區塊自迴歸擴散 (Block Autoregressive Diffusion)。
  • NVIDIA 優化
    • 利用 NVIDIA TensorRT-LLM,這是一個用於優化和加速 NVIDIA GPU 上大型語言模型 (LLM) 推論的開源函式庫。
    • 採用 FP8 和 NVFP4 量化技術,以提高性能並減少記憶體消耗,其中 NVFP4 專為 NVIDIA B200 GPU 設計。
    • 將瓶頸從記憶體頻寬(自迴歸模型常見)轉移到計算,利用 Tensor 核心處理大型平行工作負載。
    • 支援多種平行化策略(張量、管線、序列平行化)和高效的記憶體管理。
    • 與 Hugging Face 和 PyTorch 等框架整合。

🔮 前景展望AI analysis grounded in cited sources

即時 AI 應用將大幅提升使用者體驗。
DiffusionGemma 透過平行生成大幅降低延遲,將使聊天機器人、AI 助理和代理工作流的互動更流暢、即時,從而提升用戶滿意度。
邊緣 AI 部署將變得更加普及且高效。
DiffusionGemma 針對消費級 GPU 進行優化,並以開源形式發布,降低了在本地設備(如 RTX GPU、DGX Spark)上運行先進 AI 模型的門檻,鼓勵更多開發者進行邊緣部署。
混合模型架構將成為文字生成領域的趨勢。
雖然 DiffusionGemma 展示了擴散模型的優勢,但研究表明混合自迴歸和擴散模型可以結合兩者的優點,未來可能會出現更多此類模型以應對不同任務需求。

時間線

2024-02
Google 發布 Gemma 系列模型的第一個版本(Gemma 1),包含 2B 和 7B 參數模型。
2024-06
Google 發布 Gemma 2,包含 9B 和 27B 參數模型。
2025-03
Google 發布 Gemma 3,包含 1B、4B、12B 和 27B 參數模型。
2026-04
Google 發布 Gemma 4,一個開源、多模態的模型家族,支援多種尺寸和高達 256K 的上下文窗口。
2026-06-03
Google 發布 Gemma 4 12B 模型,具有統一的多模態架構,直接處理圖像和音頻輸入。
2026-06-10
Google DeepMind 發布 DiffusionGemma,一個基於 Gemma 4 的實驗性開源模型,並由 NVIDIA 優化以實現高吞吐量文字生成。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog