🧬DeepMind Blog•較早收集於 20m
介紹 Gemma 4 12B:統一的多模態模型

💡Google 推出的全新高效 12B 多模態模型,簡化架構以實現更快速的部署。
⚡ 30-Second TL;DR
有什麼變化
採用統一的無編碼器架構以處理多模態任務
為什麼重要
該模型為開發者提供了一個強大且中等規模的多模態工具,可部署於本地或私有雲。它降低了構建複雜視覺語言應用程式的門檻。
下一步行動
從 Hugging Face 下載 Gemma 4 12B 權重,並在您的本地硬體上測試其推理速度。
誰應關注:Developers & AI Engineers
關鍵要點
- •採用統一的無編碼器架構以處理多模態任務
- •12B 參數規模,針對效能與效率進行優化
- •屬於 Gemma 開放權重模型系列
🧠 深度解析
Web-grounded analysis with 23 cited sources.
🔑 增強重點摘要
- •Gemma 4 12B 採用 Apache 2.0 許可證發布,這是一個重要的轉變,因為之前的 Gemma 模型使用的是 Google 的專有條款,使得 Gemma 4 成為完全開源的模型,降低了企業採用的許可障礙。
- •該模型專為在消費級硬體上本地運行而設計,僅需 16GB VRAM 或統一記憶體即可運行,使其能夠在筆記型電腦上實現強大的多模態和代理式體驗,並支援 macOS 桌面應用程式。
- •Gemma 4 12B 在標準基準測試中表現出色,其性能接近參數規模是其兩倍的 Gemma 4 26B MoE 模型,並且明顯優於前一代 Gemma 3 27B 模型,尤其是在推理和文件理解任務上。
- •這是 Gemma 系列中第一個支援原生音訊輸入的中型模型,透過直接將原始音訊波形饋入大型語言模型骨幹,顯著降低了多模態延遲。
- •Gemma 4 12B 支援高達 256K token 的上下文窗口,並具備代理式工作流程所需的功能調用和逐步推理模式,使其適用於複雜的自動化任務。
📊 競品分析▸ Show
Gemma 4 12B 在開放權重多模態模型領域面臨來自 Meta Llama 和 Mistral AI 等公司的競爭。以下是與主要競爭對手的比較:
| 特性/模型系列 | Google Gemma 4 12B | Meta Llama 3.x/4 Scout | Mistral AI (Ministral 3, Mistral Large 3) |
|---|---|---|---|
| 參數規模 | 12B | Llama 3: 8B, 70B, 405B;Llama 3.2: 1B, 3B, 11B, 90B;Llama 4 Scout: 未指定,但強調大規模數據處理 | Ministral 3: 3B, 8B, 14B;Mistral Large 3: 41B (active), 675B (total) |
| 多模態方法 | 統一的無編碼器架構,直接將原始視覺和音訊輸入饋入 LLM 骨幹,減少延遲和記憶體佔用。 | 組合式方法,透過交叉注意力層整合預訓練的圖像/語音編碼器與語言模型。 | Ministral 3 系列具備圖像理解能力;Mistral Large 3 為通用多模態模型。 |
| 支援模態 | 文字、圖像、音訊、影片 (透過幀處理) | 文字、圖像、影片、語音 | 文字、圖像、複雜邏輯 (Mistral 3 系列),音訊 (Voxtral 系列) |
| 許可證 | Apache 2.0 | Llama 3: 自有許可證 (通常為修改後的 MIT 許可證) | Apache 2.0 (Ministral 3, Mistral Large 3) |
| 本地運行 | 專為 16GB VRAM 筆記型電腦設計,支援本地推論。 | Llama 3-V (研究模型) 體積小巧,可在本地運行。 | Ministral 3 系列專為邊緣和本地使用案例設計,可在筆記型電腦上運行。 |
| 基準性能 | GPQA Diamond 78.8%,BBEH 53,DocVQA 接近 26B 模型,MMLU Pro 77.2%。 | Llama 3 8B 和 70B 在多項基準測試中表現出色,Llama 3-V 在基準測試中比 Llava 表現好 10-20%。 | Ministral 3 在其類別中實現最佳成本效益比。 |
🛠️ 技術深入
- 統一的無編碼器架構 (Unified Encoder-Free Architecture):Gemma 4 12B 的核心創新在於其完全移除傳統多模態模型中常見的獨立視覺和音訊編碼器。
- 直接輸入 LLM 骨幹:圖像和音訊數據不再經過多階段編碼器處理,而是直接饋入大型語言模型 (LLM) 的解碼器骨幹。
- 視覺嵌入器 (Vision Embedder):取代了 Gemma 4 其他中型模型中使用的 27 層視覺 Transformer,Gemma 4 12B 使用一個輕量級的 35M 參數視覺嵌入器。原始的 48x48 像素塊透過單次矩陣乘法投影到 LLM 的隱藏維度,並透過因式分解的座標查找 (X 和 Y 矩陣) 直接附加空間位置資訊。
- 音訊波形投影 (Audio Wave Projection):消除了獨立的音訊編碼器 (例如 Gemma 4 E2B 和 E4B 中使用的 12 個 Conformer 層)。原始的 16 kHz 音訊訊號被切片成 40 毫秒的幀 (每個 640 浮點數),並線性投影到 LLM 輸入空間。
- 單一解碼器專用 Transformer:Gemma 4 12B 利用與 Gemma 4 31B Dense 模型相同的先進解碼器結構,實現了所有模態的統一處理。
- 降低延遲和記憶體佔用:透過繞過繁重的多階段編碼器,這種架構顯著減少了多模態處理的延遲和記憶體碎片化。
- 簡化微調:由於視覺、音訊和文字輸入共享完全相同的權重,因此不再需要共同調整單獨的凍結編碼器,下游適配器 (如 LoRA) 或完整微調可以在單次傳遞中自然地更新整個多模態 token 循環。
🔮 前景展望AI analysis grounded in cited sources
本地 AI 應用將加速發展。
Gemma 4 12B 能夠在配備 16GB 記憶體的消費級筆記型電腦上高效運行,將使開發者能夠在本地構建和部署更複雜的多模態 AI 應用,而無需依賴雲端基礎設施。
多模態模型架構將趨向簡化和統一。
Gemma 4 12B 的無編碼器統一架構證明了在不犧牲性能的情況下,可以透過更直接的方式處理多模態輸入,這可能會影響未來多模態模型的設計方向,以減少延遲和記憶體開銷。
開放權重模型在企業級應用中的採用率將提高。
Gemma 4 12B 在 Apache 2.0 許可證下發布,結合其強大的性能和本地運行能力,為企業提供了更大的靈活性、控制權和資料隱私,從而鼓勵其在商業產品和服務中更廣泛地採用。
⏳ 時間線
2024-02
Google DeepMind 發布 Gemma 系列的第一個版本,作為 Gemini 的輕量級版本,提供 2B 和 7B 參數模型。
2024-06
Gemma 2 發布,提供 2B、9B 和 27B 參數模型。
2025-03
Gemma 3 發布,提供 1B、4B、12B 和 27B 參數模型,並支援多語言和圖像輸入。
2026-03-31
Gemma 4 系列首次發布,包含 E2B、E4B、26B Mixture of Experts (MoE) 和 31B Dense 變體,並採用 Apache 2.0 許可證。
2026-04-16
Google 發布 Gemma 4 MTP drafters。
2026-06-03
Google DeepMind 發布 Gemma 4 12B Unified 模型,這是一款無編碼器多模態模型,支援原生音訊輸入,並可在 16GB 記憶體的筆記型電腦上運行。
📎 來源 (23)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- blog.google
- buildfastwithai.com
- wikipedia.org
- googleblog.com
- mindstudio.ai
- thenewstack.io
- venturebeat.com
- labellerr.com
- lushbinary.com
- analyticsvidhya.com
- huggingface.co
- apxml.com
- medium.com
- syncedreview.com
- amazon.com
- enlightlab.com
- mistral.ai
- infoq.com
- galileo.ai
- mistral.ai
- mistral.ai
- encord.com
- maartengrootendorst.com
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: DeepMind Blog ↗
