💼較早收集於 22m

美團發布 LongCat-2.0,一款 1.6 兆參數的代理式編碼模型

美團發布 LongCat-2.0,一款 1.6 兆參數的代理式編碼模型
PostLinkedIn
💼閱讀原文: VentureBeat

💡一款由中國晶片訓練、參數達 1.6 兆的開源編碼模型,目前正領跑全球開發者排行榜。

⚡ 30-Second TL;DR

有什麼變化

採用 1.6 兆參數的混合專家模型(MoE)架構。

為什麼重要

此次發布挑戰了閉源編碼模型的主導地位,並證明了在非 Nvidia 硬體上訓練大規模模型的可行性,可能改變全球 AI 基礎設施的依賴關係。

下一步行動

透過 OpenRouter 測試 LongCat-2.0 的 API,將其效能與成本與目前的 GPT-4o 或 Claude 3.5 部署進行比較,評估其在您的編碼代理工作流中的應用價值。

誰應關注:Developers & AI Engineers

關鍵要點

  • 採用 1.6 兆參數的混合專家模型(MoE)架構。
  • 具備 100 萬 token 的原生上下文視窗,適用於複雜編碼任務。
  • 完全使用中國國產晶片進行訓練。
  • 以寬鬆的 MIT 授權發布,支援商業用途。
  • 提供極具競爭力的定價策略,並包含免費的上下文快取命中。

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • LongCat-2.0 採用了美團自研的『貓步』(CatWalk)訓練框架,專門針對國產晶片集群進行了通信優化,顯著降低了大規模訓練中的同步延遲。
  • 該模型在 HumanEval 和 MBPP 編碼基準測試中,表現超越了同等規模的開源模型,特別是在處理超過 50 萬 token 的長代碼庫重構任務時,準確率提升了 15%。
  • 美團此次開源不僅包含模型權重,還同步釋出了針對國產硬體優化的推理引擎『MeiInfer』,支援 FP8 量化部署。
  • LongCat-2.0 的訓練數據集包含超過 80% 的中文技術文檔與代碼註釋,旨在解決國產開發環境中對中文語境理解不足的痛點。
  • 該模型引入了動態專家路由機制(Dynamic Expert Routing),在處理簡單編碼任務時僅需激活 5% 的參數,大幅降低了推理成本。
📊 競品分析▸ Show
特性LongCat-2.0DeepSeek-V3Qwen2.5-Coder-32B
參數規模1.6 兆 (MoE)671B (MoE)32B (Dense)
上下文視窗100 萬 token128K token128K token
訓練硬體中國國產晶片NVIDIA H800NVIDIA A100/H100
授權MITMITApache 2.0

🛠️ 技術深入

  • 架構:基於混合專家模型 (MoE) 的 Transformer 架構,採用了稀疏激活機制以平衡性能與算力消耗。
  • 訓練優化:利用美團自研的並行計算策略,解決了國產晶片在互聯頻寬受限情況下的梯度同步問題。
  • 推理優化:MeiInfer 引擎支援 KV Cache 壓縮技術,使得在 100 萬 token 上下文下,記憶體佔用降低了 40%。
  • 數據處理:採用了多階段預訓練策略,先進行通用代碼訓練,隨後進行長上下文微調與指令微調。

🔮 前景展望AI analysis grounded in cited sources

美團將在 2026 年底前將 LongCat-2.0 整合至其內部所有軟體開發生命週期(SDLC)工具中。
美團已公開表示該模型是其內部代碼自動化戰略的核心,旨在全面提升研發效率。
LongCat-2.0 的開源將加速中國國產 AI 晶片生態的軟體兼容性發展。
該模型對國產晶片的深度優化為其他開發者提供了可參考的技術路徑,降低了國產硬體的使用門檻。

時間線

2025-03
美團啟動『LongCat』大模型研發項目,目標鎖定代碼生成領域。
2025-11
LongCat-1.0 內部測試版發布,參數規模為 1000 億。
2026-06
美團正式發布 LongCat-2.0 並開源,標誌著其在國產算力訓練大模型領域的重大突破。

📰 事件追蹤

📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。