🖥️較早收集於 16m

Google 透過 Gemma 4 12B 將 AI 代理帶入筆記型電腦

Google 透過 Gemma 4 12B 將 AI 代理帶入筆記型電腦
PostLinkedIn
🖥️閱讀原文: Computerworld

💡在本地執行 AI 代理:Google 新推出的 12B 模型可在裝置端實現自動化,同時確保您的資料隱私。

⚡ 30-Second TL;DR

有什麼變化

Gemma 4 12B 支援在普通筆記型電腦上本地執行代理式 AI 工作流程。

為什麼重要

此發布標誌著向邊緣 AI 的轉變,使企業能夠在無雲端延遲或資料傳輸成本的情況下執行特定任務模型。然而,這也凸顯了硬體瓶頸,因為有效的執行需要大量的統一記憶體或 VRAM。

下一步行動

下載 LiteRT-LM CLI 並測試新的 'serve' 指令,將 Gemma 4 12B 連接到您現有的本地開發框架中。

誰應關注:Developers & AI Engineers

關鍵要點

  • Gemma 4 12B 支援在普通筆記型電腦上本地執行代理式 AI 工作流程。
  • 適用於 macOS 的 Google AI Edge Gallery 讓開發者能本地生成並執行資料分析腳本。
  • LiteRT-LM CLI 新增 'serve' 指令,可作為標準框架的本地 LLM 伺服器。
  • 本地部署透過將工作負載保留在裝置端,提升了資料隱私與成本效益。

🧠 深度解析

Web-grounded analysis with 16 cited sources.

🔑 增強重點摘要

  • Gemma 4 12B 採用統一的無編碼器多模態架構,讓視覺和音訊輸入直接進入大型語言模型主幹,從而減少延遲並降低記憶體佔用。
  • 它是 Gemma 系列中首個原生支援音訊輸入的中型模型,同時也支援視訊輸入。
  • Gemma 4 12B 在標準基準測試中的效能接近 Google 更大的 26B 專家混合 (MoE) 模型,但記憶體佔用不到一半。
  • 該模型可在配備 16GB VRAM 或統一記憶體的消費級筆記型電腦和 Apple Silicon Mac 上本地運行。
  • LiteRT-LM CLI 的新 'serve' 指令允許 Gemma 4 12B 作為本地、與 OpenAI 相容的 API 伺服器運行,實現與標準工具和框架的無縫整合。
📊 競品分析▸ Show
特性/模型Google Gemma 4 12BMicrosoft Aion 1.0 PlanMeta Llama 4 ScoutAlibaba Qwen3 (代表性模型)
參數規模120 億140 億170 億 (活躍), 1090 億 (總 MoE)0.6B 至 32B (密集), 30B (3B 活躍 MoE), 235B (22B 活躍 MoE)
部署方式消費級筆記型電腦本地運行 (16GB VRAM/統一記憶體)Windows 裝置內建本地運行 (消費級硬體 4 位元量化需 55-61GB VRAM)邊緣裝置至大型系統
模態支援文字、圖像、原生音訊、視訊文字原生多模態文字、圖像、視訊、音訊生成
上下文視窗256K tokens32K tokens1000 萬 tokens128K tokens (8B 及以上模型)
架構特點統一、無編碼器、解碼器專用 Transformer代理式推理與工具呼叫專家混合 (MoE)密集與 MoE 變體,混合推理模式
授權Apache 2.0開放權重開放權重開源
主要用途裝置端自主代理工作流程、多模態理解、推理裝置端代理式推理、檔案管理、子代理協調長上下文、多模態支援廣泛應用,包括推理、程式碼生成

🛠️ 技術深入

  • Gemma 4 12B 是一個密集型、僅解碼器 (decoder-only) 的 Transformer 模型。
  • 它採用統一的無編碼器架構,視覺和音訊輸入直接流入大型語言模型主幹,無需單獨的編碼器。
  • 視覺嵌入器 (Vision embedder) 包含 3500 萬個參數,取代了其他中型 Gemma 4 模型中的 27 層視覺 Transformer。原始的 48x48 像素圖像塊透過單次矩陣乘法投影到大型語言模型的隱藏維度,並透過分解座標查找附加空間位置資訊。
  • 音訊波形投影完全消除了單獨的音訊編碼器。原始的 16 kHz 音訊訊號被切片成 40 毫秒的幀,並線性投影到大型語言模型的輸入空間。
  • 統一微調 (Unified fine-tuning) 意味著視覺、音訊和文字輸入共享相同的權重,允許透過 Hugging Face 或 Unsloth 進行單次更新。
  • 模型支援高達 256K tokens 的上下文視窗。
  • Gemma 4 12B 搭載多 token 預測 (MTP) 草稿器,以減少推論延遲。
  • Gemma 4 模型(包括 12B)採用混合注意力機制,交錯使用局部滑動視窗注意力 (local sliding window attention) 和全局全上下文注意力 (full global attention) 層,確保最終層始終是全局的。
  • 訓練資料截止日期為 2025 年 1 月,包含來自網路文件、程式碼、圖像和音訊等多模態資料,涵蓋 140 多種語言。

🔮 前景展望AI analysis grounded in cited sources

裝置端 AI 代理的採用將大幅增加。
Gemma 4 12B 的本地執行和多模態能力將使更複雜的 AI 代理直接在消費級硬體上運行,從而催生新的應用類別。
AI 工作流程的資料隱私將得到顯著提升。
透過將 AI 處理保留在裝置端,Gemma 4 12B 將大大減少資料傳輸到雲端伺服器的需求,從而提高使用者信任度並符合隱私法規。
先進多模態 AI 開發將更加普及。
Gemma 4 12B 的 Apache 2.0 授權和筆記型電腦就緒特性將降低開發人員嘗試和部署強大多模態 AI 應用的門檻。

時間線

2024-02-21
Google 發布 Gemma 1 (2B 和 7B 參數規模)。
2024-06-27
Google 發布 Gemma 2 (9B 和 27B 參數規模)。
2025-03-10
Google 發布 Gemma 3 (1B、4B、12B 和 27B 參數規模)。
2026-03-31
Google 發布 Gemma 4 系列模型 (E2B、E4B、31B 和 26B A4B 參數規模)。
2026-04-02
Gemma 4 系列模型在 Apache 2.0 授權下發布。
2026-06-03
Google 發布 Gemma 4 12B Unified 模型。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Computerworld