🦙較早收集於 2h

期待 60-70B MoE 模型,激活 8-10B 參數

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡本地開發者渴望 60-70B MoE 甜蜜點,適合 64GB VRAM 超越 flash 模型(38字)

⚡ 30-Second TL;DR

有什麼變化

社群尋求 60-70B 總參數 MoE 模型

為什麼重要

突顯對高效中型開放 MoE 模型的需求,用於本地推論。可能促使開發者瞄準此「甜蜜點」,適用消費級硬體。反映社群對現有模型尺寸缺口的不滿。

下一步行動

在你的 64GB VRAM 環境中,對現有 30B MoE 模型與 flash 模型進行基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • 社群尋求 60-70B 總參數 MoE 模型
  • 8-10B 激活參數最適合 64GB VRAM
  • 可能匹敵封閉「flash」模型效能
  • 目前缺口:僅有 ~30B 與 ~120B MoE

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • Qwen3 系列已推出 MoE 模型,包括 30B-A3B(激活 3B 參數)和 235B-A22B(激活 22B 參數),填補部分中大型 MoE 缺口,但仍無 60-70B 規模。
  • DeepSeek V3 擁有 671B 總參數 MoE 架構,每次推理僅激活 37B 參數(256 專家中選 9 個),展示大規模 MoE 效率。
  • DeepSeek-V2-Lite 為 16B 總 / 2.4B 激活 MoE,可單 40G GPU 部署,使用 Multi-head Latent Attention (MLA) 壓縮 KV 快取 93.3%。
  • MoE 架構在 2025 年大幅流行,Qwen3 使用 Muon 優化器訓練,提升基準表現。

🛠️ 技術深入

  • DeepSeek V3 MoE:每 MoE 模組 256 專家,推理時激活 1 共享專家 + 8 路由選擇專家,總激活 37B 參數。
  • Qwen3 MoE 模型如 30B-A3B(激活 3B)和 235B-A22B(激活 22B),支援密集與 MoE 並行,提供彈性部署。
  • DeepSeek-V2 引入 MLA 機制,壓縮 KV 快取 93.3%,適合長上下文生成並降低 VRAM 需求。
  • Mistral Small 3(24B)經優化達 70B 模型效能,採用延遲優化 Transformer(如 grouped-query attention),推理速度快 3 倍。

🔮 前景展望AI analysis grounded in cited sources

60-70B MoE 模型將於 2026 年底前出現,激活 8-10B 參數
MoE 流行趨勢及現有 30B 與 120B+ 模型間缺口,社群需求將驅動開發填補中型高效模型。
64GB VRAM 將成中型 MoE 主流部署規格
現有如 DeepSeek-V2-Lite 證明小激活 MoE 適合單 GPU,60-70B 規模匹配此硬體提升本地運行可及性。

時間線

2024-06
DeepSeek-V2 發布,引入 MLA 機制的小型 MoE 模型
2025-01
Qwen3 系列推出,包括首個 30B-A3B MoE 模型
2025-12
DeepSeek V3 發布,671B MoE 激活 37B 參數領先效率
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。