🤗Hugging Face Blog•較早收集於 16m
JetBrains 發布 Mellum2:一款 12B 混合專家模型

💡JetBrains 以全新的 12B MoE 模型進入 LLM 領域,看看它是否適合您的本地程式輔助工具堆疊。
⚡ 30-Second TL;DR
有什麼變化
具備 12B 參數架構
為什麼重要
JetBrains 進入模型領域,暗示未來可能針對 IDE 整合的 AI 程式輔助工具進行優化。這為開發者在本地或邊緣運算程式任務中提供了另一個專業選擇。
下一步行動
前往 Hugging Face 儲存庫,評估該模型在您特定程式編寫基準測試中的表現。
誰應關注:Developers & AI Engineers
關鍵要點
- •具備 12B 參數架構
- •採用混合專家 (MoE) 設計以實現高效推論
- •由 JetBrains 開發,顯示其正深化對開發者生態系統的整合
🧠 深度解析
Web-grounded analysis with 11 cited sources.
🔑 增強重點摘要
- •Mellum2 是一款從頭開始訓練的混合專家模型,專門針對自然語言和程式碼進行優化,而非多模態模型。
- •該模型總參數為 12B,但每個 token 僅啟用 2.5B 參數,使其推論速度比同等大小的模型快兩倍以上,適用於高吞吐量、低延遲的生產環境。
- •Mellum2 已在 Apache 2.0 許可下開源,並提供六種變體,包括專為複雜推理和代理工作流程設計的「Thinking」版本。
- •其主要應用場景包括 AI 工作負載路由、構建低延遲 RAG (檢索增強生成) 管道、驅動複雜工作流程中的子代理以及支援私有部署。
- •Mellum2 延續了 JetBrains 在 AI 助理中提供程式碼補全功能的基礎,並將其擴展到更廣泛的自然語言和軟體工程任務。
📊 競品分析▸ Show
| 模型名稱/公司 | 總參數 (MoE 活躍參數) | 許可證 | 主要優勢/專注領域 | 基準性能 (Mellum2 參考) |
|---|---|---|---|---|
| JetBrains Mellum2 | 12B (2.5B 活躍) | Apache 2.0 | 高效推論、低延遲、程式碼與自然語言、路由、RAG、子代理 | 程式碼生成、推理、科學、數學基準具競爭力;推論速度快 2 倍以上。 AIME 表現遜於 Qwen 3.5 4B。 |
| Qwen 3.5 / 3.6 (阿里巴巴) | 0.6B 至 235B (含 MoE) | Apache 2.0 | 程式碼、多語言 (尤其 CJK)、代理任務、混合思維模式 | Qwen 3.5 4B 在 AIME 基準上優於 Mellum2 12B。 Qwen 3.6 27B 在 SWE-bench 上得分 77.2%。 |
| Mistral AI (Codestral, Mixtral) | Mixtral (MoE), Codestral 22B | Apache 2.0 (Mixtral) | 程式碼補全 (Codestral)、推理、多語言、歐洲語言、函數調用、JSON 模式 | Codestral 22B 針對 FIM 優化,是 IDE 自動補全的推薦模型。 |
| DeepSeek Coder / R1 / V4 | R1 (671B 總參數, 37B 活躍) | Apache 2.0 | 程式碼生成、補全、解釋、數學、科學、推理、代理任務 | DeepSeek Coder 在 HumanEval 上達到 80%+。 DeepSeek R1 專注於推理。 |
| Kimi K2.6 (Moonshotai) | 1T 總參數 (42B 活躍) | MIT | 綜合程式碼、數學、推理、代理任務、高真實世界基準分數 | 真實世界基準得分 87/100,被評為最佳整體程式碼模型。 |
| Gemma 3 (Google) | 1B, 4B, 27B | Apache 2.0 | 資源受限環境、設備端推論、推理、程式碼、多模態 | 27B 模型在推理和程式碼任務上超越許多 70B 模型。 |
🛠️ 技術深入
- Mellum2 採用混合專家 (MoE) 架構,總參數為 120 億,每個 token 僅啟用 25 億參數。
- 「Thinking」變體模型使用 64 個專家,每個 token 激活 8 個專家。
- 模型結合了滑動窗口和全注意力層,上下文長度為 131,072 個 token,滑動窗口為 1,024 個 token。
- 詞彙量大小為 98,304,精度為 bfloat16。
- 「Thinking」變體是通過監督式微調 (SFT) 和可驗證獎勵強化學習 (RLVR) 從基礎模型訓練而來,訓練數據集包含更困難的長篇數學子集。
- Mellum2 專門針對自然語言和程式碼數據進行訓練,並非多模態模型。
🔮 前景展望AI analysis grounded in cited sources
JetBrains 將進一步鞏固其在開發者專用 AI 工具領域的領導地位。
透過開源 Mellum2 這樣高效、專業化的 MoE 模型,JetBrains 賦予開發者將先進 AI 功能直接整合到其工作流程中的能力,從而強化其生態系統。
開源社群中針對特定任務的專業化、高效 MoE 模型趨勢將加速發展。
Mellum2 專注於低延遲、高吞吐量的程式碼和自然語言任務,證明了專用模型相較於通用模型的價值,將鼓勵類似的發展。
JetBrains 將持續深化其專有和開源 AI 模型與其 IDE 和 AI Assistant 的整合。
Mellum2 是原始 Mellum 的演進,後者為 AI Assistant 中的程式碼補全提供支援,這表明 JetBrains 正在其產品套件中不斷改進和整合自有模型。
⏳ 時間線
2000-02
JetBrains (最初名為 IntelliJ Software) 成立。
2011
JetBrains 創建 Kotlin 程式語言。
2023-12
JetBrains AI Assistant 公開可用,整合多種 LLM。
2025-01
JetBrains 的 AI 程式碼代理 Junie 推出封閉預覽版。
2025-04
原始 Mellum (4B 參數) 發布,為 JetBrains AI Assistant 提供雲端程式碼補全功能;Junie 正式推出。
2026-05-27
JetBrains 針對 Kotlin 和 Java 的 AI 代理框架 Koog 1.0 發布。
2026-06-01
JetBrains 發布 Mellum2 (12B 混合專家模型) 並開源。
📎 來源 (11)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog ↗
