🗾較早收集於 10h

Google 發布可在本地 PC 運行的 Gemma 4 12B 多模態模型

Google 發布可在本地 PC 運行的 Gemma 4 12B 多模態模型
PostLinkedIn
🗾閱讀原文: ITmedia AI+ (日本)

💡使用 Google 新的開放模型,在 16GB 記憶體的硬體上於本地運行高效能多模態 AI。

⚡ 30-Second TL;DR

有什麼變化

120 億參數的多模態模型

為什麼重要

在消費級硬體上運行高效能多模態模型的能力,降低了本地 AI 開發的門檻。這將加速私有化、離線 AI 應用程式的部署。

下一步行動

下載 Gemma 4 12B 權重,並在您的 16GB 記憶體本地機器上測試其多模態推論速度,以評估其是否適合邊緣部署。

誰應關注:Developers & AI Engineers

關鍵要點

  • 120 億參數的多模態模型
  • 採用無編碼器(encoder-free)整合架構
  • 針對 16GB 記憶體筆電優化,具備接近上位模型的效能

🧠 深度解析

Web-grounded analysis with 18 cited sources.

🔑 增強重點摘要

  • Gemma 4 12B 於 2026 年 6 月 3 日發布,是 Google Gemma 4 系列中的最新成員,該系列模型皆以 Apache 2.0 許可證開放權重,允許不受限制的商業使用。
  • 該模型採用獨特的「統一」(Unified)無編碼器架構,直接將原始圖像補丁和音頻波形投影到大型語言模型的嵌入空間中,顯著降低了多模態任務的延遲並減少了記憶體使用,與傳統依賴獨立編碼器的模型不同。
  • Gemma 4 12B 支援高達 256K token 的上下文窗口,使其能夠處理冗長的文檔、程式碼或語音轉錄,並具備原生的代理工具使用能力和明確的逐步推理模式,適用於複雜的工作流程。
  • 儘管參數為 120 億,Gemma 4 12B 在標準基準測試中的性能接近 Google 更大的 26B Mixture-of-Experts (MoE) 模型,但記憶體佔用不到其一半,使其能在配備 16GB VRAM 或統一記憶體的消費級筆記型電腦上高效運行。
  • 該模型支援文字、圖像、音頻和影片輸入(影片透過處理幀序列),其中音頻輸入是 Gemma 系列中首次在中型模型上實現原生支援,最大音頻長度為 30 秒,影片為 60 秒(每秒一幀)。

🛠️ 技術深入

  • 架構類型:解碼器專用(decoder-only)Transformer 模型,其核心解碼器結構與 Gemma 4 31B Dense 模型相似。
  • 無編碼器機制
    • 視覺處理:以一個輕量級嵌入模組(35M 參數)取代傳統視覺編碼器,該模組透過單一矩陣乘法、位置嵌入和正規化,將原始 48x48 像素圖像補丁直接投影到大型語言模型的嵌入空間。
    • 音頻處理:完全移除音頻編碼器,將原始 16 kHz 音頻訊號切片為 40 毫秒的幀(每個 640 浮點數),並線性投影到大型語言模型的輸入空間。
  • 注意力機制:採用混合注意力機制,交錯使用局部滑動窗口注意力與全局全上下文注意力層,確保最終層始終為全局注意力。較小的密集模型使用 512 token 的滑動窗口,較大的模型使用 1024 token。
  • 旋轉位置嵌入 (RoPE):雙重 RoPE 配置,標準 RoPE 用於滑動層,剪枝 RoPE 用於全局層,以支援更長的上下文。
  • 分層嵌入 (PLE):在較小的模型(E2B、E4B)中,每個解碼器層都有自己的小型嵌入表,以最大化參數效率。
  • 上下文窗口:支援高達 256K token 的上下文窗口。
  • 支援模態:原生處理文字、圖像和音頻輸入,並可透過處理幀序列支援影片輸入。音頻輸入的最大長度為 30 秒,影片為 60 秒(假設每秒一幀)。
  • 量化支援:可透過 4 位元量化在 8GB RAM 上運行,或透過 8 位元量化在 14GB RAM 上運行。
  • 許可證:以 Apache 2.0 許可證發布。
  • 部署生態系統:可在 Hugging Face、Kaggle、Ollama、LM Studio 和 Google AI Edge 上使用。支援 vLLM、llama.cpp、MLX、SGLang 和 Unsloth 等推斷和微調工具鏈。
  • 多 token 預測 (MTP) 草稿器:額外發布專用的 MTP 草稿器模型,以減少本地推斷延遲。

🔮 前景展望AI analysis grounded in cited sources

促進隱私敏感型本地 AI 應用程式的普及。
Gemma 4 12B 能夠在消費級硬體上本地運行並採用 Apache 2.0 許可證,使得企業和個人用戶能夠在設備上處理敏感數據,避免雲端 API 的隱私風險和合規性問題。
加速個人設備上的代理式 AI 開發。
該模型原生的代理工具使用能力和先進的推理模式,結合其本地執行特性,將賦予開發者直接在筆記型電腦上構建和部署自主代理的強大能力。
推動消費級硬體上多模態應用程式的創新。
無編碼器架構顯著降低了多模態任務的延遲和記憶體佔用,使得在筆記型電腦和邊緣設備上開發和部署即時音頻和視覺應用程式變得更加容易。

時間線

2024-02
Google 發布 Gemma 系列模型,最初提供 2B 和 7B 兩種尺寸,作為 Gemini 的輕量級版本。
2024-06
Google 發布 Gemma 2 系列模型,包含 9B 和 27B 兩種尺寸。
2025-03
Google 發布 Gemma 3 系列模型。
2026-04
Google 發布 Gemma 4 系列模型,包含 E2B、E4B、26B A4B 和 31B 等版本,並採用 Apache 2.0 開源許可。
2026-06-03
Google 發布 Gemma 4 12B Unified 模型,這是一個無編碼器多模態模型,專為在本地 PC 上高效運行而優化。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本)