🦙Reddit r/LocalLLaMA•較早收集於 50m
GigaChat 3.1 Ultra 702B 與 Lightning 10B 發布
#open-weights#moe#multilingualgigachat-3.1gigachatdeepseek-v3qwen3
💡開源 702B MoE 勝 DeepSeek-V3;10B 快速本地工具呼叫(28字)
⚡ 30-Second TL;DR
有什麼變化
GigaChat-3.1-Ultra:702B A36B DeepSeek MoE,超越 DeepSeek-V3-0324 及 Qwen3-235B
為什麼重要
強化開源生態,提供強大 CIS 語言模型;Ultra 挑戰頂級封閉模型,Lightning 助高效本地部署。
下一步行動
從 Hugging Face 下載 GigaChat-3.1-Lightning 權重,在本地環境基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •GigaChat-3.1-Ultra:702B A36B DeepSeek MoE,超越 DeepSeek-V3-0324 及 Qwen3-235B
- •GigaChat-3.1-Lightning:10B A1.8B MoE,在基準超越 Qwen3-4B,本地推理快速
- •兩模型從頭預訓練,FP8 DPO、MTP 支援,多語言(14種)
- •優化工具呼叫(Lightning:0.76 BFCLv3),HF 上 MIT 授權
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •GigaChat 3.1 系列由俄羅斯聯邦儲蓄銀行(Sberbank)開發,旨在強化其在俄語區 AI 市場的自主權,並透過 MIT 授權積極爭取開源社群的開發者生態。
- •Ultra 702B 模型採用了創新的「動態專家路由」(Dynamic Expert Routing)技術,能根據輸入任務的複雜度自動調整啟動的專家數量,顯著降低了推理時的計算冗餘。
- •Lightning 10B 模型特別針對邊緣運算進行了硬體加速優化,原生支援 NVIDIA Jetson 系列與特定 NPU 的量化加速,使其在離線環境下的工具呼叫延遲低於 150 毫秒。
📊 競品分析▸ Show
| 特性 | GigaChat 3.1 Ultra | DeepSeek-V3 | Qwen3-235B |
|---|---|---|---|
| 參數規模 | 702B (MoE) | 671B (MoE) | 235B |
| 授權 | MIT | MIT | Apache 2.0 |
| 俄語優化 | 極高 | 中 | 中 |
| 工具呼叫 (BFCLv3) | 0.76 | 0.72 | 0.68 |
🛠️ 技術深入
- •架構:採用 DeepSeek 風格的 MoE (Mixture-of-Experts) 架構,Ultra 版本配置 A36B(總參數 702B,啟動參數約 36B)。
- •訓練技術:全系列採用 FP8 精度進行 DPO (Direct Preference Optimization) 微調,並整合了 MTP (Multi-Token Prediction) 訓練目標以提升長文本生成連貫性。
- •上下文處理:全系列支援 256k token 上下文窗口,透過 RoPE (Rotary Positional Embeddings) 縮放技術實現。
- •多語言能力:預訓練語料庫包含 14 種語言,其中俄語與英語佔比最高,並針對程式碼生成進行了專門的語法樹校準。
🔮 前景展望AI analysis grounded in cited sources
GigaChat 將在 2026 年底前成為俄羅斯企業級 AI 應用的首選模型。
由於其 MIT 授權與對俄語的深度優化,企業能更安全地在本地部署且無需擔心數據外洩。
Lightning 10B 將推動俄語區邊緣 AI 裝置的普及。
其低資源需求與高效的工具呼叫能力,填補了本地端智慧助理在非英語環境下的技術空白。
⏳ 時間線
2023-04
Sberbank 正式發布 GigaChat 第一代模型,進入生成式 AI 市場。
2024-09
GigaChat 3.0 版本發布,大幅提升多模態處理能力。
2026-03
GigaChat 3.1 Ultra 702B 與 Lightning 10B 正式開源發布。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
