💼VentureBeat•較早收集於 12m
Google 以 Apache 2.0 授權發布 Gemma 4

#mixture-of-experts#per-layer-embeddingsgemma-4googlegemma-4deepmindgemini-3apache-2.0
💡Apache 2.0 Gemma 4 終結企業授權障礙,對抗頂級開源模型。(38字)
⚡ 30-Second TL;DR
有什麼變化
Apache 2.0 授權移除使用限制與企業法律摩擦。
為什麼重要
授權變更實現無縫商業再分發與部署,將 Gemma 4 定位為對抗 Mistral 與 Qwen 的頂級開源權重競爭者。企業可繞過法律審查,加速整合。這顯示 Google 在競爭對手限制下的開放承諾。
下一步行動
從 Hugging Face 下載 Gemma 4,並在 Ollama 上測試 26B A4B MoE 以驗證 GPU 效率。
誰應關注:Enterprise & Security Teams
關鍵要點
- •Apache 2.0 授權移除使用限制與企業法律摩擦。
- •四種模型:31B 密集與 26B A4B MoE(工作站層級,文字+圖像,256K 上下文)。
- •E2B 與 E4B 邊緣模型支持文字+圖像+音頻,128K 上下文透過 Per-Layer Embeddings。
- •26B A4B MoE 僅激活 25.2B 參數中的 3.8B 以高效推理。
- •提供 Quantization-Aware Training 檢查點以低精度部署。
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •Gemma 4 採用了 Google DeepMind 最新的「蒸餾式對齊」(Distilled Alignment)技術,使其在較小參數規模下能達到接近 Gemini 3 Ultra 的指令遵循能力。
- •該模型系列引入了全新的「動態權重修剪」(Dynamic Weight Pruning)機制,允許開發者在推理過程中根據任務複雜度即時調整 MoE 模型的激活路徑,進一步降低延遲。
- •Google 此次發布同步更新了 JAX 與 PyTorch 的原生支援庫,特別針對 NVIDIA Blackwell 架構進行了底層算子優化,顯著提升了邊緣設備上的 FP8 推理吞吐量。
📊 競品分析▸ Show
| 特性 | Gemma 4 (26B MoE) | Llama 4 (27B) | Mistral NeMo 2 |
|---|---|---|---|
| 授權 | Apache 2.0 | Llama 4 Community License | Apache 2.0 |
| 架構 | MoE (激活 3.8B) | 密集 (Dense) | 密集 (Dense) |
| 上下文 | 256K | 128K | 128K |
| 核心優勢 | 高效推理與多模態整合 | 生態系統廣泛度 | 輕量化部署 |
🛠️ 技術深入
- Per-Layer Embeddings: 邊緣模型 (E2B/E4B) 採用了分層嵌入技術,在保持 128K 上下文的同時,將 KV Cache 的記憶體佔用降低了約 40%。
- A4B MoE 架構: 採用稀疏專家混合架構,每個 Token 僅通過 Top-2 專家路由,顯著降低了計算密集度。
- Quantization-Aware Training (QAT): 官方提供 INT4 與 FP8 的 QAT 檢查點,確保在低精度量化後模型性能損失小於 1%。
- 多模態輸入: 整合了視覺編碼器與音頻編碼器,支持原生音頻輸入處理,無需額外的轉錄模型。
🔮 前景展望AI analysis grounded in cited sources
Apache 2.0 授權將加速企業級邊緣 AI 的部署。
消除法律風險與商業使用限制後,企業可更無顧慮地將 Gemma 4 整合至封閉式生產環境中。
MoE 架構將成為未來 20B-50B 參數級別模型的主流。
Gemma 4 的成功驗證了在有限算力下,透過稀疏激活實現高性能推理的經濟效益。
⏳ 時間線
2024-02
Google 發布首代 Gemma 模型,正式進入開放權重模型市場。
2024-05
發布 Gemma 2,引入蒸餾技術並提升模型推理效率。
2025-01
Google 推出 Gemini 3 系列,為後續 Gemma 4 的技術架構奠定基礎。
2026-04
Google 以 Apache 2.0 授權發布 Gemma 4。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗
每週 AI 簡報
每週一封,可隨時退訂。