🇨🇳cnBeta (Full RSS)•較早收集於 2m
Google 發布開源 Gemma 4 12B 多模態模型

💡使用 Google 新發布的 12B 開源模型,在 16GB 記憶體的硬體上本地運行高效能多模態 AI。
⚡ 30-Second TL;DR
有什麼變化
12B 參數規模,針對本地執行進行優化
為什麼重要
此發布顯著降低了開發者在邊緣設備上部署高效能多模態 AI 的門檻,無需依賴雲端 API。
下一步行動
下載 Gemma 4 12B 權重,並在您的本地機器上測試其多模態推論速度,以評估其對邊緣應用程式的適用性。
誰應關注:Developers & AI Engineers
關鍵要點
- •12B 參數規模,針對本地執行進行優化
- •僅需 16GB 記憶體/顯存即可運行
- •效能表現媲美先前的 26B 模型版本
- •完全開源,提升開發者可訪問性
🧠 深度解析
Web-grounded analysis with 16 cited sources.
🔑 增強重點摘要
- •Gemma 4 12B採用創新的「編碼器自由」(encoder-free) 統一架構,將多模態數據(視覺和音訊)直接饋入大型語言模型主幹,顯著降低了傳統多模態模型中常見的延遲和記憶體佔用。
- •這是Gemma系列中首個中型模型,能夠原生處理音訊輸入,並支援透過處理影格來理解影片內容,擴展了其多模態能力。
- •Gemma 4 12B在Apache 2.0許可證下發布,這是一個寬鬆的開源許可證,允許商業使用、修改、分發和再授權,為開發者和企業提供了更大的靈活性,避免了早期Gemma版本中較為模糊的條款。
- •該模型支援代理工作流程(agentic workflows)和原生函數調用,並包含一個「思考模式」(thinking mode),能夠進行逐步推理,使其在複雜任務中表現更為強大。
- •Google為Gemma 4 12B發布了可下載的macOS桌面應用程式,讓開發者可以直接在消費級Apple Silicon設備上體驗完全本地化的語音和視覺互動。
🛠️ 技術深入
- 模型架構: 採用統一的、編碼器自由的解碼器專用Transformer架構。多模態數據(視覺、音訊)直接輸入到大型語言模型主幹。
- 視覺處理: 以輕量級的35M參數視覺嵌入模組取代傳統視覺編碼器。原始的48x48像素塊透過單一矩陣乘法和因子化座標查找直接投影到LLM隱藏維度。
- 音訊處理: 完全移除獨立的音訊編碼器。原始的16 kHz音訊訊號(40毫秒幀)被線性投影到LLM輸入空間。
- 統一微調: 視覺、音訊和文本輸入共享相同的權重,允許單次微調整個模型(例如透過Hugging Face或Unsloth)。
- 上下文窗口: 支援高達256K token的上下文窗口。
- 多token預測 (MTP): 包含一個專用的MTP模型,用於推測解碼,以減少推理延遲。
- 支援模態: 文本、圖像、影片(作為幀處理)和原生音訊輸入。音訊最大長度為30秒,影片最大長度為60秒(假設每秒處理一幀)。
- 記憶體需求: 在16位元精度下,需要16GB的VRAM或統一記憶體。透過量化,可在8GB RAM(4位元)或14GB(8位元)下運行。
- 推理堆疊相容性: 與llama.cpp、MLX、vLLM、Ollama、SGLang、Unsloth和LM Studio等工具相容。
- 思考模式: 內建原生「思考模式」,透過
<|channel>thoughttoken啟用,支援逐步推理。
🔮 前景展望AI analysis grounded in cited sources
本地AI應用將加速普及並變得更加複雜。
Gemma 4 12B的編碼器自由多模態架構和低記憶體需求,使其能在消費級硬體上高效運行,將推動更多具備視覺和音訊理解能力的本地AI應用開發。
企業將能更安全地部署多模態AI解決方案。
Apache 2.0開源許可證允許商業使用和本地執行,使得企業能夠在不將敏感數據傳輸到雲端的情況下,處理多模態數據,滿足嚴格的隱私和合規性要求。
多模態模型架構設計將朝向更精簡、更整合的方向發展。
Gemma 4 12B的編碼器自由架構證明了在不犧牲性能的前提下,可以大幅減少多模態處理的延遲和記憶體佔用,這可能引導未來模型設計的趨勢。
⏳ 時間線
2024-02
Google首次發布Gemma系列模型,包含2B和7B兩種尺寸。
2024-04
Google發布Gemma 1.1,帶來性能改進和錯誤修復,並推出CodeGemma和RecurrentGemma變體。
2024-06
Google發布Gemma 2,包含9B和27B兩種尺寸,性能更高且推理效率更佳。
2025-03
Google發布Gemma 3,提供1B、4B、12B和27B等多種尺寸。
2026-03
Google發布Gemma 4系列模型,包括E2B、E4B、31B和26B A4B尺寸。
2026-06
Google發布Gemma 4 12B統一多模態模型,具備編碼器自由架構和本地運行能力。
📎 來源 (16)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: cnBeta (Full RSS) ↗


