🤗較早收集於 16m

JetBrains 發布 Mellum2:一款 12B 混合專家模型

JetBrains 發布 Mellum2:一款 12B 混合專家模型
PostLinkedIn
🤗閱讀原文: Hugging Face Blog

💡JetBrains 以全新的 12B MoE 模型進入 LLM 領域,看看它是否適合您的本地程式輔助工具堆疊。

⚡ 30-Second TL;DR

有什麼變化

具備 12B 參數架構

為什麼重要

JetBrains 進入模型領域,暗示未來可能針對 IDE 整合的 AI 程式輔助工具進行優化。這為開發者在本地或邊緣運算程式任務中提供了另一個專業選擇。

下一步行動

前往 Hugging Face 儲存庫,評估該模型在您特定程式編寫基準測試中的表現。

誰應關注:Developers & AI Engineers

關鍵要點

  • 具備 12B 參數架構
  • 採用混合專家 (MoE) 設計以實現高效推論
  • 由 JetBrains 開發,顯示其正深化對開發者生態系統的整合

🧠 深度解析

Web-grounded analysis with 11 cited sources.

🔑 增強重點摘要

  • Mellum2 是一款從頭開始訓練的混合專家模型,專門針對自然語言和程式碼進行優化,而非多模態模型。
  • 該模型總參數為 12B,但每個 token 僅啟用 2.5B 參數,使其推論速度比同等大小的模型快兩倍以上,適用於高吞吐量、低延遲的生產環境。
  • Mellum2 已在 Apache 2.0 許可下開源,並提供六種變體,包括專為複雜推理和代理工作流程設計的「Thinking」版本。
  • 其主要應用場景包括 AI 工作負載路由、構建低延遲 RAG (檢索增強生成) 管道、驅動複雜工作流程中的子代理以及支援私有部署。
  • Mellum2 延續了 JetBrains 在 AI 助理中提供程式碼補全功能的基礎,並將其擴展到更廣泛的自然語言和軟體工程任務。
📊 競品分析▸ Show
模型名稱/公司總參數 (MoE 活躍參數)許可證主要優勢/專注領域基準性能 (Mellum2 參考)
JetBrains Mellum212B (2.5B 活躍)Apache 2.0高效推論、低延遲、程式碼與自然語言、路由、RAG、子代理程式碼生成、推理、科學、數學基準具競爭力;推論速度快 2 倍以上。 AIME 表現遜於 Qwen 3.5 4B。
Qwen 3.5 / 3.6 (阿里巴巴)0.6B 至 235B (含 MoE)Apache 2.0程式碼、多語言 (尤其 CJK)、代理任務、混合思維模式Qwen 3.5 4B 在 AIME 基準上優於 Mellum2 12B。 Qwen 3.6 27B 在 SWE-bench 上得分 77.2%。
Mistral AI (Codestral, Mixtral)Mixtral (MoE), Codestral 22BApache 2.0 (Mixtral)程式碼補全 (Codestral)、推理、多語言、歐洲語言、函數調用、JSON 模式Codestral 22B 針對 FIM 優化,是 IDE 自動補全的推薦模型。
DeepSeek Coder / R1 / V4R1 (671B 總參數, 37B 活躍)Apache 2.0程式碼生成、補全、解釋、數學、科學、推理、代理任務DeepSeek Coder 在 HumanEval 上達到 80%+。 DeepSeek R1 專注於推理。
Kimi K2.6 (Moonshotai)1T 總參數 (42B 活躍)MIT綜合程式碼、數學、推理、代理任務、高真實世界基準分數真實世界基準得分 87/100,被評為最佳整體程式碼模型。
Gemma 3 (Google)1B, 4B, 27BApache 2.0資源受限環境、設備端推論、推理、程式碼、多模態27B 模型在推理和程式碼任務上超越許多 70B 模型。

🛠️ 技術深入

  • Mellum2 採用混合專家 (MoE) 架構,總參數為 120 億,每個 token 僅啟用 25 億參數。
  • 「Thinking」變體模型使用 64 個專家,每個 token 激活 8 個專家。
  • 模型結合了滑動窗口和全注意力層,上下文長度為 131,072 個 token,滑動窗口為 1,024 個 token。
  • 詞彙量大小為 98,304,精度為 bfloat16。
  • 「Thinking」變體是通過監督式微調 (SFT) 和可驗證獎勵強化學習 (RLVR) 從基礎模型訓練而來,訓練數據集包含更困難的長篇數學子集。
  • Mellum2 專門針對自然語言和程式碼數據進行訓練,並非多模態模型。

🔮 前景展望AI analysis grounded in cited sources

JetBrains 將進一步鞏固其在開發者專用 AI 工具領域的領導地位。
透過開源 Mellum2 這樣高效、專業化的 MoE 模型,JetBrains 賦予開發者將先進 AI 功能直接整合到其工作流程中的能力,從而強化其生態系統。
開源社群中針對特定任務的專業化、高效 MoE 模型趨勢將加速發展。
Mellum2 專注於低延遲、高吞吐量的程式碼和自然語言任務,證明了專用模型相較於通用模型的價值,將鼓勵類似的發展。
JetBrains 將持續深化其專有和開源 AI 模型與其 IDE 和 AI Assistant 的整合。
Mellum2 是原始 Mellum 的演進,後者為 AI Assistant 中的程式碼補全提供支援,這表明 JetBrains 正在其產品套件中不斷改進和整合自有模型。

時間線

2000-02
JetBrains (最初名為 IntelliJ Software) 成立。
2011
JetBrains 創建 Kotlin 程式語言。
2023-12
JetBrains AI Assistant 公開可用,整合多種 LLM。
2025-01
JetBrains 的 AI 程式碼代理 Junie 推出封閉預覽版。
2025-04
原始 Mellum (4B 參數) 發布,為 JetBrains AI Assistant 提供雲端程式碼補全功能;Junie 正式推出。
2026-05-27
JetBrains 針對 Kotlin 和 Java 的 AI 代理框架 Koog 1.0 發布。
2026-06-01
JetBrains 發布 Mellum2 (12B 混合專家模型) 並開源。

📎 來源 (11)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. huggingface.co
  2. jetbrains.com
  3. techzine.eu
  4. huggingface.co
  5. aiweekly.co
  6. reddit.com
  7. promptquorum.com
  8. gmicloud.ai
  9. huggingface.co
  10. siliconflow.com
  11. developersdigest.tech
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog