💼較早收集於 15m

Cohere 發布採用 Apache 2.0 授權的開源權重模型 Command A+

Cohere 發布採用 Apache 2.0 授權的開源權重模型 Command A+
PostLinkedIn
💼閱讀原文: VentureBeat

💡首款採用 Apache 2.0 授權、針對本地部署與複雜推理優化的前沿級 MoE 模型。

⚡ 30-Second TL;DR

有什麼變化

採用 2180 億參數的稀疏混合專家(MoE)架構,每步僅激活 250 億參數。

為什麼重要

此發布使企業能夠在本地運行前沿級推理模型,減少對專有雲端 API 的依賴。它為優先考慮硬體效率與主權數據控制的開源模型樹立了新標準。

下一步行動

從 Hugging Face 下載 Command A+ 權重,並針對您目前的本地推理環境測試 W4A4 量化效能。

誰應關注:Developers & AI Engineers

關鍵要點

  • 採用 2180 億參數的稀疏混合專家(MoE)架構,每步僅激活 250 億參數。
  • 於 Hugging Face 以寬鬆的 Apache 2.0 授權發布,支援企業部署主權 AI。
  • 支援包括 W4A4 在內的高級量化格式,在不犧牲推理品質的前提下大幅降低記憶體佔用。

🧠 深度解析

Web-grounded analysis with 25 cited sources.

🔑 增強重點摘要

  • Command A+ 是一款多模態模型,支援視覺輸入,並具備卓越的多語言能力,支援 48 種語言,包括所有歐盟官方語言,同時顯著提升了非歐洲語言(如阿拉伯語、日語和韓語)的分詞效率,從而降低了全球部署的營運成本。
  • 該模型在硬體效率方面表現出色,僅需兩張 NVIDIA H100 或一張 B200 GPU 即可部署。透過 W4A4 量化,其輸出速度可達每秒 375 個 token (TOPS),首個 token 延遲僅 113 毫秒,相較於先前的 Command A Reasoning 模型,輸出速度提升高達 63%,延遲降低 17%。
  • Command A+ 專為企業應用而設計,擅長處理複雜的檢索增強生成 (RAG) 管線、多步驟 SQL 生成、高風險金融文件分析以及自主或半自主使用外部工具的代理工作流程。它還引入了原生引用功能,能將事實聲明直接連結到來源文件。
  • Cohere 透過獨特的量化方法解決了「量化稅」問題,僅將 MoE 專家量化為 4 位元,同時保持關鍵注意力路徑的全精度,並輔以「量化感知蒸餾」(Quantization-Aware Distillation) 技術,實現了近乎無損的壓縮。
  • Command A+ 支援 128K 輸入 token 和 64K 輸出 token 的上下文長度,使其能夠處理大量資訊以進行複雜的推理和生成任務。
📊 競品分析▸ Show
模型名稱總參數活躍參數授權多模態上下文視窗推薦硬體 (W4A4/類似量化)
Cohere Command A+2180 億250 億Apache 2.0視覺輸入、文本128K 輸入 / 64K 輸出1x B200 或 2x H100 GPU
Mistral Small 41190 億60 億Apache 2.0文本、圖像256K4x H100 或 1x B200 GPU
Mistral Large 36750 億410 億Apache 2.0文本、圖像256K單一 8x GPU 節點 (搭配 NVFP4 量化)
Meta Llama 4 Maverick4000 億170 億開源權重 (Open-weight)文本、圖像、影片10M (Scout)支援 Apple Silicon (M3 Ultra) 等本地硬體

🛠️ 技術深入

  • 模型架構: Command A+ 採用解碼器專用稀疏混合專家 (MoE) Transformer 模型。它包含 128 個專家,每個 token 僅激活 8 個專家,並有一個單一的共享專家應用於所有 token。
  • 注意力層: 注意力層以 3:1 的比例交錯使用帶有旋轉位置嵌入 (Rotational Positional Embeddings) 的滑動視窗注意力層和不帶位置嵌入的全局注意力層,此設計首次在 Command A 中引入。
  • MoE 層訓練: 稀疏 MoE 層以完全無丟失 (dropless) 的方式訓練,並使用 token 選擇路由器。模型採用基於加性偏差的負載平衡機制,以鼓勵所有專家之間的 token 負載均衡,並將 softmax 路由器激活函數替換為 top-k 專家 logits 的歸一化 sigmoid。
  • 量化方法: 為實現近乎無損的壓縮,MoE 專家被量化為 4 位元,而關鍵的注意力路徑則保持全精度,並輔以量化感知蒸餾 (Quantization-Aware Distillation) 技術。W4A4 量化是 Cohere 推薦的選項,因其卓越的速度、低延遲和較小的硬體佔用。
  • 分詞器 (Tokenizer): 經過全面改進,針對全球企業使用進行優化,原生支援 48 種語言。它顯著提高了非歐洲語言的分詞效率,例如將阿拉伯語的 token 數量減少 20%,日語減少 18%,韓語減少 16%。
  • 部署要求: 該模型可在單張 NVIDIA Blackwell B200 GPU 或兩張 NVIDIA H100 GPU 上高效運行。
  • 訓練數據 (Command A 相關): 訓練數據集經過精心篩選,包含來自公共網路的文本和程式碼、內部生成的合成數據、人類標註的指令微調數據以及來自專業供應商的高品質數據。
  • 訓練框架 (Command A 相關): 使用基於 JAX 的分散式訓練框架,在 NVIDIA H100 GPU 集群上進行訓練,並利用 JAX 的 GSPMD 作為骨幹來實現複雜的分片策略,同時利用 FP8 Tensor Cores 提高效率。

🔮 前景展望AI analysis grounded in cited sources

開源 MoE 模型將加速企業採用主權 AI 解決方案。
Command A+ 的 Apache 2.0 授權和對本地部署的優化,降低了企業在數據主權和合規性方面的障礙,使其能夠在受監管行業中大規模部署 AI。
多模態和多語言能力的結合將推動 AI 代理在國際企業工作流程中的普及。
Command A+ 支援視覺輸入、48 種語言及優化的非歐洲語言分詞效率,使其能處理全球化企業中複雜且多樣的數據和溝通需求。
高效能的低位元量化技術將成為大型模型在邊緣和有限硬體環境中部署的關鍵。
Command A+ 透過 W4A4 量化在僅兩張 H100 GPU 上實現高效推理,證明了在不犧牲品質的前提下,大幅降低運算資源需求的可行性。

時間線

2017-06
Cohere 聯合創始人 Aidan Gomez 共同撰寫了開創性的 Transformer 架構論文「Attention Is All You Need」。
2019-XX
Cohere 由 Aidan Gomez、Ivan Zhang 和 Nick Frosst 在多倫多成立,旨在使自然語言處理技術更易於開發者使用。
2021-11
Cohere 推出其 API,並與 Google Cloud 合作,利用其基礎設施和 TPU 進行模型開發和部署。
2024-08
Cohere 發布 Command R+ 模型,這是一款用於複雜 RAG 工作流程和多步驟工具使用的對話式模型。
2025-03
Cohere 推出 Command A,一款 1110 億參數的企業級 LLM,專為代理、多語言和高效部署而優化。
2026-04
Cohere 同意收購德國 AI 公司 Aleph Alpha,旨在擴大其在政府和受監管行業的主權 AI 解決方案。
2026-05-20
Cohere 發布 Command A+,這是其首個稀疏混合專家 (MoE) 模型,採用 Apache 2.0 授權,並針對複雜推理和代理工作流程進行優化。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat