
Z.ai 推出開源 GLM-5.1,在 SWE-Bench 上擊敗 Opus 與 GPT
Z.ai 發布 GLM-5.1,一款 754B 參數開源 MoE LLM,採用 MIT 授權在 Hugging Face 上提供,可自主工作長達 8 小時。它透過「階梯模式」優化,在 SWE-Bench Pro 上超越 Claude Opus 4.6 與 GPT 5.4。模型可處理 1,700 步驟與數千工具呼叫而不偏離策略。
Tag: #moe72 results

Z.ai 發布 GLM-5.1,一款 754B 參數開源 MoE LLM,採用 MIT 授權在 Hugging Face 上提供,可自主工作長達 8 小時。它透過「階梯模式」優化,在 SWE-Bench Pro 上超越 Claude Opus 4.6 與 GPT 5.4。模型可處理 1,700 步驟與數千工具呼叫而不偏離策略。

Google DeepMind 推出 Gemma 4,這是開放權重多模態模型,尺寸包括 E2B、E4B、26B A4B 和 31B。它們處理文字、圖像、影片和音訊,具備高達 256K 上下文,並強化推理、程式設計和代理功能。提供 Dense 和 MoE 變體,適合裝置端部署。
分析顯示,在 8xB200 節點上使用 NVFP4 精度搭配 TP=4 副本配置,效能顯著優於標準的 TP=8 配置。此方法可使節點吞吐量翻倍並改善每位使用者的延遲。

NVIDIA 推出了 Nemotron-Labs-3-Puzzle-75B-A9B,這是一款使用「Iterative Puzzle」壓縮框架進行部署優化的模型。其吞吐量較前代提升 2 倍,同時保持了高準確度。

Tencent 發布了其 295B 參數 Hy3 模型的完整版本,並採用寬鬆的 Apache 2.0 授權。該模型採用混合專家(MoE)架構,定位為現有開源權重模型的高效能、生產級替代方案。

美團開源了 LongCat-2.0,這是一款擁有 1.6 兆參數的混合專家模型(MoE),專為自主軟體工程設計。該模型具備 100 萬 token 的上下文視窗,且完全使用中國晶片進行訓練。
華為正式開源了擁有 920 億參數的 openPangu-2.0-Flash 模型。此次發布是華為支援昇騰 AI 生態系統廣泛策略的一部分。
由曹越創立的 Sand.ai 完成超億美元融資,致力於開發自回歸視頻生成模型。該公司正轉向混合專家模型(MoE)架構,以平衡推理成本、速度與生成品質。

本地 LLM 部署的突破:混合 Mamba+MoE 模型在消費級硬體 (4x3090) 上實現了高達 504K token 的完美檢索。該架構使用固定大小的循環狀態來避免 KV 快取膨脹。

NVIDIA 發布了使用 NVFP4 資料類型的 Alibaba Qwen3.6-35B-A3B 量化版本。此優化在保持與原始 BF16 模型相當效能的同時,顯著降低了 GPU 記憶體與磁碟空間需求。