
Cohere 發布採用 Apache 2.0 授權的開源權重模型 Command A+
Cohere 推出了 Command A+,這是一款擁有 2180 億參數的稀疏混合專家模型(MoE),並採用 Apache 2.0 授權發布。該模型針對複雜推理與代理工作流進行了優化,並透過先進的量化技術保持了極高的執行效率。
Tag: #moe72 results

Cohere 推出了 Command A+,這是一款擁有 2180 億參數的稀疏混合專家模型(MoE),並採用 Apache 2.0 授權發布。該模型針對複雜推理與代理工作流進行了優化,並透過先進的量化技術保持了極高的執行效率。

AIDC-AI 推出了 Ovis2.6-80B-A3B,這是一款採用專家混合(MoE)架構的多模態大型語言模型。它具備「圖像思考」(Think with Image)能力,允許模型在推理過程中主動操作視覺輸入。

Zyphra 發布 ZAYA1-8B,這是一個開放的 8B 參數混合專家推理模型,在 AMD Instinct MI300 GPU 上訓練,在基準測試中與 GPT-5-High 和 DeepSeek-V3.2 競爭。Apache 2.0 授權可在 Hugging Face 免費下載並自訂。它具備創新的 MoE++ 架構,提供優異效率。

DeepSeek 洽談3億美元融資,投後估值達100億美元。V4基準測試洩露,MMLU-Pro 91.2、AIME 2025 96.4、SWE-bench 59.6 領先業界。發布延遲,因MoE架構從CUDA遷移至華為昇騰晶片。

阿里巴巴開源 Qwen3.6-35B-A3B,這款 35B 參數模型僅啟用 3B 活躍參數。在代理編碼任務中實現頂級性能。

Qwen3.6-35B-A3B 是全新開源稀疏 MoE 模型,總參數 35B,活躍參數 3B,採用 Apache 2.0 許可。代理編碼能力媲美活躍參數大 10 倍的模型,並具強大多模態感知與思考/非思考模式。可於 HuggingFace、ModelScope 及 Qwen Studio 下載。
阿里巴巴推出 Marco-Mini-Instruct(17.3B 總數,0.86B 激活,5%)與 Marco-Nano(8B,0.6B 激活)。在英文/多語基準勝 Qwen3-4B、Gemma3-12B。Apache 2.0,HF 模型可用。
GigaChat 在 Hugging Face 以 MIT 授權發布 GigaChat-3.1-Ultra(702B MoE)與 GigaChat-3.1-Lightning(10B MoE)開放權重。從頭預訓練,在基準測試超越 DeepSeek-V3 與 Qwen3,優化英文/俄文及工具呼叫。Ultra 適合高資源環境;Lightning 擅長本地推理,支援 256k 上下文。
HauhauCS 發布了 Qwen3.5-122B-A10B Aggressive 的無審查 GGUF 版本,拒絕率為零且無能力損失。它引入了新的 K_P 量化方法,以最小檔案大小增加提供優越品質。模型支援 262K 上下文及多模態輸入。
Mistral Small 4 在 transformers 的 PR 將 Instruct、Reasoning 與 Devstral 統一為單一混合模型。具備 119B MoE、多模態輸入與可配置推理。以 Apache 2.0 開源,提供代理功能。