🦙較早收集於 11h

社群對 124B Gemma 模型的期待

社群對 124B Gemma 模型的期待
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡了解社群對於 124B Gemma 等大型開源權重模型的需求與期待。

⚡ 30-Second TL;DR

有什麼變化

社群對於將 Gemma 擴展至 124B 參數的需求。

為什麼重要

向模型開發者傳達了一個重要訊號:市場對於能與封閉式巨頭競爭的高參數開源權重模型有顯著需求。

下一步行動

如果您正在尋找高參數的開源權重替代方案,請持續關注 Google 官方關於 Gemma 系列的發布更新。

誰應關注:Researchers & Academics

關鍵要點

  • 社群對於將 Gemma 擴展至 124B 參數的需求。
  • 反映了尋求更大規模開源權重模型以進行複雜推理的趨勢。
  • 突顯了 Gemma 架構在研究人員中的受歡迎程度。

🧠 深度解析

Web-grounded analysis with 23 cited sources.

🔑 增強重點摘要

  • Google Gemma 模型最初於 2024 年 2 月發布,提供 2B 和 7B 參數版本,隨後在 2024 年 6 月推出 Gemma 2 (9B, 27B),2025 年 3 月推出 Gemma 3 (1B, 4B, 12B, 27B),並於 2026 年 4 月發布 Gemma 4,包含 31B 密集型和 26B 混合專家 (MoE) 模型,其中 MoE 模型在推論時僅啟用約 3.8B 參數以提高效率。
  • Gemma 4 採用 Apache 2.0 開源許可證發布,這與早期版本採用的原始碼可用許可證不同,大幅降低了商業使用和再分發的法律限制,促進了更廣泛的採用和創新生態系統的發展。
  • Gemma 模型家族展現了強勁的社群採用率,自首次發布以來,下載量已超過 4 億次,並催生了超過 10 萬個社群變體,形成了一個活躍的「Gemmaverse」。
  • Google AI 負責人 Jeff Dean 曾提及一個「1240 億參數的混合專家模型」,但隨後該說法被淡化,引發了社群對此大型 Gemma 模型是否存在及其潛在發布的持續猜測。
  • Gemma 4 引入了多模態能力,支援文字、圖像、音訊和視訊輸入,並具備高達 256K token 的長上下文視窗,使其能夠處理複雜的推理和代理工作流程。
📊 競品分析▸ Show
模型家族最新版本參數規模 (活躍參數)上下文視窗許可證關鍵能力/特點
Google GemmaGemma 4 (2026-04)E2B, E4B, 26B MoE (~3.8B 活躍), 31B 密集型128K (E2B/E4B), 256K (26B/31B)Apache 2.0多模態 (文字、圖像、音訊、視訊), 多語言 (140+), 代理工作流程, 邊緣設備優化
Meta LlamaLlama 4 Maverick (2026-04) / Llama 3.3 70B (2026-02)Llama 3.3 70B, Llama 4 Maverick (未指定)128K (Llama 3.3)Meta 許可證通用型, 大型社群支援, 卓越的推理、編碼和多語言能力
Mistral AI MistralMistral Large 2 (2024-12)123B (Mistral Large 2), Mixtral MoE (46.7B 總參數, 12.9B 活躍)128K (Mistral Large 2)Apache 2.0 (核心模型)高效率架構, 程式碼生成, 聊天機器人, 企業部署優化
Microsoft PhiPhi-4 (2026-02)3.8B (Phi-3.5-mini), 14B (Phi-3-medium), 41.9B (Phi-3.5-MoE, 6.6B 活躍)16K (Phi-4), 128K (Phi-3.5 變體)MIT 許可證專注於高品質合成數據訓練, 數學/STEM 推理, 邊緣部署
Alibaba QwenQwen 2.5 72B (2026-04)72B1M+ (Qwen3-235B)Apache 2.0編碼能力強, 多語言, 長上下文
DeepSeekDeepSeek-V3 (2026-02)671B (MoE, 37B 活躍)128KMIT 許可證卓越的性價比, 複雜推理, 代理工作流程

🛠️ 技術深入

  • Gemma 模型家族基於 Transformer 解碼器架構,並從 Google 的 Gemini 模型中汲取研究和技術。
  • 初始的 Gemma 1 (2B, 7B) 模型採用旋轉位置嵌入 (RoPE);2B 模型使用多查詢注意力 (MQA),而 7B 模型使用多頭注意力 (MHA)。活化函數為 GeGLU。
  • Gemma 2 轉向使用分組查詢注意力 (GQA),以提高 GPU 記憶體效率和可擴展性。
  • Gemma 4 引入了混合注意力機制,交錯使用滑動視窗注意力(用於局部上下文效率)和全域全上下文注意力層(用於長距離依賴性),這對於其 256K token 的上下文視窗至關重要。
  • Gemma 4 的混合專家 (MoE) 模型(例如 26B MoE)包含 128 個專家,但在推論時每個 token 僅啟用其中 2 個專家,將活躍參數數量從 26B 減少到約 3.8B,從而實現高效推論。
  • Gemma 4 的邊緣模型 (E2B, E4B) 採用「逐層嵌入」(Per-Layer Embeddings, PLE) 技術,透過將參數快取到快速本地儲存來最大化參數效率,以適應行動和物聯網設備。
  • Gemma 模型的詞彙量為 256K token,使用基於 SentencePiece 的 tokenizer,能夠處理多樣化的文字輸入。
  • 訓練數據主要包括英文網路文件、數學和程式碼。Gemma 4 擴展到支援超過 140 種語言和多模態輸入(文字、圖像、音訊、視訊)。

🔮 前景展望AI analysis grounded in cited sources

Google 將很可能發布更大規模的 Gemma 模型,包括傳聞中的 124B 版本,以滿足社群對複雜推理能力的需求。
社群對 124B 模型的強烈期待,加上 Google 過去不斷擴大 Gemma 模型參數規模的趨勢,以及 Jeff Dean 意外提及 124B 模型的事件,都表明 Google 意識到此需求並可能最終實現它。
Gemma 等大型開源模型將加速 AI 應用程式的發展,使其能在從邊緣設備到雲端的多元硬體環境中運行,從而實現更廣泛的 AI 普及。
Gemma 4 已經展現出多模態和長上下文能力,並針對不同設備進行優化,這將使開發者能夠在資源受限的環境中部署更複雜的 AI 解決方案,推動 AI 技術的民主化。
Gemma 4 採用 Apache 2.0 許可證將顯著提升其在商業和研究領域的採用率,促進一個更豐富的衍生模型和專業應用生態系統。
完全開放的 Apache 2.0 許可證消除了商業使用和再分發的法律障礙,鼓勵了更廣泛的實驗、客製化和將 Gemma 模型整合到專有產品和服務中。

時間線

2024-02
Gemma 首次發布,提供 2B 和 7B 參數模型。
2024-06
Gemma 2 首次發布,提供 9B 和 27B 參數模型。
2025-03
Gemma 3 發布,提供 1B、4B、12B 和 27B 參數模型。
2025-04
CodeGemma 和 RecurrentGemma 首次發布。
2026-04
Gemma 4 發布,包含 E2B、E4B、26B MoE 和 31B 密集型模型,並採用 Apache 2.0 許可證,支援多模態和多語言功能。
2026-04
Google AI 負責人 Jeff Dean 提及一個 124B 參數的混合專家模型,引發社群對其存在的猜測。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA