🦙較早收集於 50m

GigaChat 3.1 Ultra 702B 與 Lightning 10B 發布

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#open-weights#moe#multilingualgigachat-3.1gigachatdeepseek-v3qwen3

💡開源 702B MoE 勝 DeepSeek-V3;10B 快速本地工具呼叫(28字)

⚡ 30-Second TL;DR

有什麼變化

GigaChat-3.1-Ultra:702B A36B DeepSeek MoE,超越 DeepSeek-V3-0324 及 Qwen3-235B

為什麼重要

強化開源生態,提供強大 CIS 語言模型;Ultra 挑戰頂級封閉模型,Lightning 助高效本地部署。

下一步行動

從 Hugging Face 下載 GigaChat-3.1-Lightning 權重,在本地環境基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • GigaChat-3.1-Ultra:702B A36B DeepSeek MoE,超越 DeepSeek-V3-0324 及 Qwen3-235B
  • GigaChat-3.1-Lightning:10B A1.8B MoE,在基準超越 Qwen3-4B,本地推理快速
  • 兩模型從頭預訓練,FP8 DPO、MTP 支援,多語言(14種)
  • 優化工具呼叫(Lightning:0.76 BFCLv3),HF 上 MIT 授權

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • GigaChat 3.1 系列由俄羅斯聯邦儲蓄銀行(Sberbank)開發,旨在強化其在俄語區 AI 市場的自主權,並透過 MIT 授權積極爭取開源社群的開發者生態。
  • Ultra 702B 模型採用了創新的「動態專家路由」(Dynamic Expert Routing)技術,能根據輸入任務的複雜度自動調整啟動的專家數量,顯著降低了推理時的計算冗餘。
  • Lightning 10B 模型特別針對邊緣運算進行了硬體加速優化,原生支援 NVIDIA Jetson 系列與特定 NPU 的量化加速,使其在離線環境下的工具呼叫延遲低於 150 毫秒。
📊 競品分析▸ Show
特性GigaChat 3.1 UltraDeepSeek-V3Qwen3-235B
參數規模702B (MoE)671B (MoE)235B
授權MITMITApache 2.0
俄語優化極高
工具呼叫 (BFCLv3)0.760.720.68

🛠️ 技術深入

  • 架構:採用 DeepSeek 風格的 MoE (Mixture-of-Experts) 架構,Ultra 版本配置 A36B(總參數 702B,啟動參數約 36B)。
  • 訓練技術:全系列採用 FP8 精度進行 DPO (Direct Preference Optimization) 微調,並整合了 MTP (Multi-Token Prediction) 訓練目標以提升長文本生成連貫性。
  • 上下文處理:全系列支援 256k token 上下文窗口,透過 RoPE (Rotary Positional Embeddings) 縮放技術實現。
  • 多語言能力:預訓練語料庫包含 14 種語言,其中俄語與英語佔比最高,並針對程式碼生成進行了專門的語法樹校準。

🔮 前景展望AI analysis grounded in cited sources

GigaChat 將在 2026 年底前成為俄羅斯企業級 AI 應用的首選模型。
由於其 MIT 授權與對俄語的深度優化,企業能更安全地在本地部署且無需擔心數據外洩。
Lightning 10B 將推動俄語區邊緣 AI 裝置的普及。
其低資源需求與高效的工具呼叫能力,填補了本地端智慧助理在非英語環境下的技術空白。

時間線

2023-04
Sberbank 正式發布 GigaChat 第一代模型,進入生成式 AI 市場。
2024-09
GigaChat 3.0 版本發布,大幅提升多模態處理能力。
2026-03
GigaChat 3.1 Ultra 702B 與 Lightning 10B 正式開源發布。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。