☁️AWS Machine Learning Blog•較早收集於 6m
Gemma 4 模型現已登陸 Amazon Bedrock

💡直接在 AWS 生態系統中存取 Google 最新的開放權重多模態模型,加速企業級應用擴展。
⚡ 30-Second TL;DR
有什麼變化
包含三種變體:Gemma 4 31B、26B-A4B 與 E2B。
為什麼重要
Gemma 4 在 Bedrock 上的可用性,為企業開發者提供了更便捷的管道來使用高效能開放權重模型。這簡化了將多模態功能整合至現有 AWS AI 工作流程的過程。
下一步行動
在 Amazon Bedrock 上部署 Gemma 4 變體,並針對您的代理應用程式測試其函數呼叫功能。
誰應關注:Developers & AI Engineers
關鍵要點
- •包含三種變體:Gemma 4 31B、26B-A4B 與 E2B。
- •採用密集架構與混合專家模型 (MoE) 架構。
- •支援原生函數呼叫 (function calling) 與文字轉影像的多模態輸入。
- •以 Apache 2.0 開放權重授權發布。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 39 個來源。
🔑 增強重點摘要
- •Gemma 4 模型系列顯著擴展了上下文視窗,其中 E2B 和 E4B 支援 128K tokens,而 26B A4B 和 31B Dense 模型則支援高達 256K tokens,大幅提升處理長文件和複雜對話的能力。
- •除了文字轉影像,Gemma 4 的多模態能力更深入,支援長達 60 秒的影片理解(1fps)以及 E2B、E4B 和 12B 模型上的原生音訊輸入,特別是 12B 模型採用無編碼器架構,直接將原始音訊和影像資料饋送至 LLM 骨幹,顯著降低延遲和記憶體佔用。
- •Gemma 4 在性能與效率之間取得平衡,其中 26B A4B 混合專家模型 (MoE) 在推論時僅啟用 3.8 億參數,卻能達到與大型模型相媲美的性能,使其在消費級 GPU 上運行時極具成本效益;而 31B Dense 模型在 Arena 的文字排行榜上名列前茅(例如第三名)。
- •Gemma 4 模型系列針對廣泛的硬體進行優化,從智慧型手機和 Raspberry Pi 等邊緣設備(E2B、E4B)到筆記型電腦(12B)以及工作站/伺服器(26B、31B),支援本地離線執行,為開發者提供極大的部署彈性。
- •Gemma 4 的原生函數呼叫功能是從頭開始訓練的,並利用專用特殊 token 和可配置的「思考模式」,支援多步驟推理和結構化輸出,使其成為構建自主 AI 代理的強大工具,能夠與外部 API 互動並執行複雜的工作流程。
📊 競品分析▸ Show
| 特性/模型 | Gemma 4 (Google DeepMind) | Llama 3/4 (Meta) | Qwen 3.5 (Alibaba) | Claude 3 (Anthropic) |
|---|---|---|---|---|
| 授權 | Apache 2.0 開放權重 | 開放權重 (Llama 4) | 開放權重 (Qwen 3.5) | 專有 |
| 架構 | 密集與混合專家模型 (MoE),包含 E2B、E4B、12B、26B A4B、31B Dense | 多種尺寸,包含 Llama 4 Maverick 17B Instruct, Llama 4 Scout 17B Instruct | 多種尺寸,包含 Qwen3 Coder Next | 多種尺寸,包含 Claude Mythos 5, Claude Fable 5 |
| 多模態輸入 | 文字、影像、影片、音訊 (E2B, E4B, 12B 支援原生音訊) | Llama 4 在 E2B 和 E4B 尺寸上不支援原生音訊輸入 | 支援文字、影像 | 支援文字、影像 |
| 上下文視窗 | E2B/E4B 128K tokens;12B/26B/31B 256K tokens | Llama 4 支援 1000 萬 tokens (Llama 4) | 支援長上下文 | 支援長上下文 |
| 函數呼叫/代理能力 | 原生函數呼叫,支援「思考模式」 | 支援工具呼叫 | 強大的工具呼叫和結構化推理 | 支援代理工作流程 |
| 基準測試 (MMLU) | 31B 模型 87.1% | Llama 4 70B 性能與 Gemma 2 27B 相當 | Qwen 3.5 在 MMLU Pro 上略勝一籌 | 領先模型 |
| 基準測試 (編碼) | 31B 模型 HumanEval 76.8% | - | Qwen 3.5 在編碼基準測試中具有明顯優勢 | - |
| 推論效率 | 26B MoE 僅啟用 3.8B 參數,高效 | - | Qwen 3.5 在原始推論速度上略勝一籌 | - |
| 部署目標 | 邊緣設備、筆記型電腦、消費級 GPU、伺服器 | - | 本地部署可行 | - |
🛠️ 技術深入
- 混合注意力機制 (Hybrid Attention Mechanism):Gemma 4 模型採用混合注意力機制,交錯使用局部滑動視窗注意力 (local sliding window attention) 和全局注意力 (global attention),以平衡速度和感知能力。全局注意力層應用比例式旋轉位置嵌入 (Proportional RoPE, p-RoPE) 以管理長上下文任務的記憶體開銷。
- 分層嵌入 (Per-Layer Embeddings, PLE):針對邊緣優化模型 (E2B 和 E4B),Gemma 4 使用分層嵌入,將 token 特定訊號饋送至每個解碼器層,僅在相關時才處理資訊,而非預先載入,從而提高效率。
- 共享鍵值快取 (Shared KV Cache):最終層重用早期層的鍵值狀態,顯著減少推論期間的記憶體佔用。
- 無編碼器多模態架構 (Encoder-Free Multimodal Architecture):Gemma 4 12B 模型引入統一的無編碼器架構,直接將影像和音訊輸入饋送至 LLM 骨幹,無需單獨的編碼器,從而降低多模態處理的延遲和記憶體碎片化。
- 輕量級視覺嵌入器 (Lightweight Vision Embedder):Gemma 4 12B 的視覺嵌入器僅有 3500 萬參數,透過單一矩陣乘法將原始 48x48 像素塊投影到 LLM 隱藏維度,並透過因子化座標查找附加空間位置資訊。
- 音訊波形投影 (Audio Wave Projection):Gemma 4 12B 透過將原始 16 kHz 音訊訊號切片並線性投影到 LLM 輸入空間,消除了單獨的音訊編碼器。
- 混合專家模型 (MoE) 細節:26B A4B MoE 模型總參數為 260 億,但在推論時僅啟用 3.8 億至 40 億的活躍參數,使其在提供接近 31B 密集模型性能的同時,大幅降低了計算需求。
- 原生函數呼叫 (Native Function Calling):Gemma 4 的函數呼叫功能是從頭開始訓練的,使用專用特殊 token 來建立結構化的函數呼叫生命週期,而非依賴提示工程,這提高了其可靠性。
- 思考模式 (Thinking Mode):模型內建推理引擎,允許在生成最終回應前進行逐步處理,可透過
<|think|>token 或enable_thinking參數觸發,有助於複雜的代理任務。
🔮 前景展望AI analysis grounded in cited sources
開放權重模型將加速企業採用 AI 代理。
Gemma 4 的 Apache 2.0 授權、原生函數呼叫和思考模式,降低了企業在本地部署和客製化 AI 代理的法律與技術障礙。
邊緣設備上的多模態 AI 應用將大幅增加。
Gemma 4 的 E2B 和 E4B 模型專為手機和 IoT 設備設計,支援原生音訊和影像輸入,且能在有限記憶體下高效運行,將推動更多本地化、低延遲的多模態應用。
開源模型生態系統的競爭將更加激烈,促使模型在性能和授權方面更具吸引力。
隨著 Google 等主要參與者發布具有競爭力性能和寬鬆 Apache 2.0 授權的模型,其他模型開發者將面臨壓力,需提供類似的優勢以保持市場份額。
⏳ 時間線
2024-02
Gemma 1 (2B, 7B) 首次發布,作為輕量級開源模型。
2024-04
Gemma 1.1 發布,引入性能改進和錯誤修復。
2024-06
Gemma 2 (9B, 27B) 首次發布,採用新架構以提升性能和效率。
2024-07
Gemma 2 (2B) 發布,進一步擴展 Gemma 2 系列。
2025-03
Gemma 3 (1B, 4B, 12B, 27B) 發布,支援多模態輸入。
2026-04
Gemma 4 (E2B, E4B, 26B A4B, 31B) 發布,採用 Apache 2.0 開放權重授權。
2026-06
Gemma 4 12B Unified 模型發布,具有統一的無編碼器多模態架構。
2026-06-10
Gemma 4 模型系列正式登陸 Amazon Bedrock。
📎 來源 (39)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- ollama.com
- kaggle.com
- deepinfra.com
- qubrid.com
- wikipedia.org
- labellerr.com
- huggingface.co
- googleblog.com
- blog.google
- venturebeat.com
- medium.com
- aurigait.com
- gemma4-ai.com
- medium.com
- medium.com
- maartengrootendorst.com
- thenewstack.io
- medium.com
- aws-news.com
- google.dev
- machinelearningmastery.com
- gemma4-ai.com
- lushbinary.com
- dev.to
- mindstudio.ai
- blog.google
- googleblog.com
- mindstudio.ai
- amazon.com
- github.io
- googleblog.com
- medium.com
- techtarget.com
- blog.google
- google.dev
- googleblog.com
- thenextweb.com
- amazon.com
- amazon.com
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。


