☁️較早收集於 6m

Gemma 4 模型現已登陸 Amazon Bedrock

Gemma 4 模型現已登陸 Amazon Bedrock
PostLinkedIn
☁️閱讀原文: AWS Machine Learning Blog
#open-weight#multimodal#aws-bedrock#google-deepmindgemma-4google deepmindgemma 4amazon bedrockaws

💡直接在 AWS 生態系統中存取 Google 最新的開放權重多模態模型,加速企業級應用擴展。

⚡ 30-Second TL;DR

有什麼變化

包含三種變體:Gemma 4 31B、26B-A4B 與 E2B。

為什麼重要

Gemma 4 在 Bedrock 上的可用性,為企業開發者提供了更便捷的管道來使用高效能開放權重模型。這簡化了將多模態功能整合至現有 AWS AI 工作流程的過程。

下一步行動

在 Amazon Bedrock 上部署 Gemma 4 變體,並針對您的代理應用程式測試其函數呼叫功能。

誰應關注:Developers & AI Engineers

關鍵要點

  • 包含三種變體:Gemma 4 31B、26B-A4B 與 E2B。
  • 採用密集架構與混合專家模型 (MoE) 架構。
  • 支援原生函數呼叫 (function calling) 與文字轉影像的多模態輸入。
  • 以 Apache 2.0 開放權重授權發布。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 39 個來源。

🔑 增強重點摘要

  • Gemma 4 模型系列顯著擴展了上下文視窗,其中 E2B 和 E4B 支援 128K tokens,而 26B A4B 和 31B Dense 模型則支援高達 256K tokens,大幅提升處理長文件和複雜對話的能力。
  • 除了文字轉影像,Gemma 4 的多模態能力更深入,支援長達 60 秒的影片理解(1fps)以及 E2B、E4B 和 12B 模型上的原生音訊輸入,特別是 12B 模型採用無編碼器架構,直接將原始音訊和影像資料饋送至 LLM 骨幹,顯著降低延遲和記憶體佔用。
  • Gemma 4 在性能與效率之間取得平衡,其中 26B A4B 混合專家模型 (MoE) 在推論時僅啟用 3.8 億參數,卻能達到與大型模型相媲美的性能,使其在消費級 GPU 上運行時極具成本效益;而 31B Dense 模型在 Arena 的文字排行榜上名列前茅(例如第三名)。
  • Gemma 4 模型系列針對廣泛的硬體進行優化,從智慧型手機和 Raspberry Pi 等邊緣設備(E2B、E4B)到筆記型電腦(12B)以及工作站/伺服器(26B、31B),支援本地離線執行,為開發者提供極大的部署彈性。
  • Gemma 4 的原生函數呼叫功能是從頭開始訓練的,並利用專用特殊 token 和可配置的「思考模式」,支援多步驟推理和結構化輸出,使其成為構建自主 AI 代理的強大工具,能夠與外部 API 互動並執行複雜的工作流程。
📊 競品分析▸ Show
特性/模型Gemma 4 (Google DeepMind)Llama 3/4 (Meta)Qwen 3.5 (Alibaba)Claude 3 (Anthropic)
授權Apache 2.0 開放權重開放權重 (Llama 4)開放權重 (Qwen 3.5)專有
架構密集與混合專家模型 (MoE),包含 E2B、E4B、12B、26B A4B、31B Dense多種尺寸,包含 Llama 4 Maverick 17B Instruct, Llama 4 Scout 17B Instruct多種尺寸,包含 Qwen3 Coder Next多種尺寸,包含 Claude Mythos 5, Claude Fable 5
多模態輸入文字、影像、影片、音訊 (E2B, E4B, 12B 支援原生音訊)Llama 4 在 E2B 和 E4B 尺寸上不支援原生音訊輸入支援文字、影像支援文字、影像
上下文視窗E2B/E4B 128K tokens;12B/26B/31B 256K tokensLlama 4 支援 1000 萬 tokens (Llama 4)支援長上下文支援長上下文
函數呼叫/代理能力原生函數呼叫,支援「思考模式」支援工具呼叫強大的工具呼叫和結構化推理支援代理工作流程
基準測試 (MMLU)31B 模型 87.1%Llama 4 70B 性能與 Gemma 2 27B 相當Qwen 3.5 在 MMLU Pro 上略勝一籌領先模型
基準測試 (編碼)31B 模型 HumanEval 76.8%-Qwen 3.5 在編碼基準測試中具有明顯優勢-
推論效率26B MoE 僅啟用 3.8B 參數,高效-Qwen 3.5 在原始推論速度上略勝一籌-
部署目標邊緣設備、筆記型電腦、消費級 GPU、伺服器-本地部署可行-

🛠️ 技術深入

  • 混合注意力機制 (Hybrid Attention Mechanism):Gemma 4 模型採用混合注意力機制,交錯使用局部滑動視窗注意力 (local sliding window attention) 和全局注意力 (global attention),以平衡速度和感知能力。全局注意力層應用比例式旋轉位置嵌入 (Proportional RoPE, p-RoPE) 以管理長上下文任務的記憶體開銷。
  • 分層嵌入 (Per-Layer Embeddings, PLE):針對邊緣優化模型 (E2B 和 E4B),Gemma 4 使用分層嵌入,將 token 特定訊號饋送至每個解碼器層,僅在相關時才處理資訊,而非預先載入,從而提高效率。
  • 共享鍵值快取 (Shared KV Cache):最終層重用早期層的鍵值狀態,顯著減少推論期間的記憶體佔用。
  • 無編碼器多模態架構 (Encoder-Free Multimodal Architecture):Gemma 4 12B 模型引入統一的無編碼器架構,直接將影像和音訊輸入饋送至 LLM 骨幹,無需單獨的編碼器,從而降低多模態處理的延遲和記憶體碎片化。
  • 輕量級視覺嵌入器 (Lightweight Vision Embedder):Gemma 4 12B 的視覺嵌入器僅有 3500 萬參數,透過單一矩陣乘法將原始 48x48 像素塊投影到 LLM 隱藏維度,並透過因子化座標查找附加空間位置資訊。
  • 音訊波形投影 (Audio Wave Projection):Gemma 4 12B 透過將原始 16 kHz 音訊訊號切片並線性投影到 LLM 輸入空間,消除了單獨的音訊編碼器。
  • 混合專家模型 (MoE) 細節:26B A4B MoE 模型總參數為 260 億,但在推論時僅啟用 3.8 億至 40 億的活躍參數,使其在提供接近 31B 密集模型性能的同時,大幅降低了計算需求。
  • 原生函數呼叫 (Native Function Calling):Gemma 4 的函數呼叫功能是從頭開始訓練的,使用專用特殊 token 來建立結構化的函數呼叫生命週期,而非依賴提示工程,這提高了其可靠性。
  • 思考模式 (Thinking Mode):模型內建推理引擎,允許在生成最終回應前進行逐步處理,可透過 <|think|> token 或 enable_thinking 參數觸發,有助於複雜的代理任務。

🔮 前景展望AI analysis grounded in cited sources

開放權重模型將加速企業採用 AI 代理。
Gemma 4 的 Apache 2.0 授權、原生函數呼叫和思考模式,降低了企業在本地部署和客製化 AI 代理的法律與技術障礙。
邊緣設備上的多模態 AI 應用將大幅增加。
Gemma 4 的 E2B 和 E4B 模型專為手機和 IoT 設備設計,支援原生音訊和影像輸入,且能在有限記憶體下高效運行,將推動更多本地化、低延遲的多模態應用。
開源模型生態系統的競爭將更加激烈,促使模型在性能和授權方面更具吸引力。
隨著 Google 等主要參與者發布具有競爭力性能和寬鬆 Apache 2.0 授權的模型,其他模型開發者將面臨壓力,需提供類似的優勢以保持市場份額。

時間線

2024-02
Gemma 1 (2B, 7B) 首次發布,作為輕量級開源模型。
2024-04
Gemma 1.1 發布,引入性能改進和錯誤修復。
2024-06
Gemma 2 (9B, 27B) 首次發布,採用新架構以提升性能和效率。
2024-07
Gemma 2 (2B) 發布,進一步擴展 Gemma 2 系列。
2025-03
Gemma 3 (1B, 4B, 12B, 27B) 發布,支援多模態輸入。
2026-04
Gemma 4 (E2B, E4B, 26B A4B, 31B) 發布,採用 Apache 2.0 開放權重授權。
2026-06
Gemma 4 12B Unified 模型發布,具有統一的無編碼器多模態架構。
2026-06-10
Gemma 4 模型系列正式登陸 Amazon Bedrock。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。