國產大模型稱霸全球Token調用
中國模型佔OpenRouter前十六席,小米MiMo-V2-Pro以4.82萬億Token領先;自2026年2月起超越美國模型。價格差距10-60倍推動高Token代理應用如OpenClaw採用。SWE-Bench基準性能逼近美國對手。
Tag: #moe72 results
中國模型佔OpenRouter前十六席,小米MiMo-V2-Pro以4.82萬億Token領先;自2026年2月起超越美國模型。價格差距10-60倍推動高Token代理應用如OpenClaw採用。SWE-Bench基準性能逼近美國對手。

Self-Routing 提出一種無參數 MoE 層路由機制,直接使用 token 隱藏狀態的指定子空間作為專家 logits,消除學習路由器。它在 GPT-2 規模語言建模和 ImageNet-1K 分類上匹配學習路由器性能,並具備更好的專家平衡。結果顯示路由熵高 17%,無需負載平衡損失。

全新 APEX MoE 模型量化技術,在準確度上優於 Unsloth Dynamic 2.0 且體積減半,以 Qwen3.5-35B-A3B 為基準。提供從 12GB VRAM 的 GPU 等級,兼容標準 llama.cpp,並透過 TurboQuant 提示處理加速 14%。開源,模型在 Hugging Face。

NVIDIA 的 gpt-oss-puzzle-88B 經 Puzzle NAS 從 gpt-oss-120b 衍生,參數減至 88B,在 8x H100 長上下文下吞吐量提升 1.63 倍。它匹配母模型準確度,透過 MoE 架構調整優化 H100 推論。專為推理工作負載設計。

Mistral AI 推出 Forge 系統,讓企業以內部文件、程式碼、資料建置專屬模型。支援預訓練、後訓練、強化學習客製化,涵蓋密集型與 MoE 架構。模型提供策略自主並可持續強化學習改進。
對 Qwen3.5-397B NVFP4 在 4x RTX PRO 6000 上花 8 小時基準測試 MoE 後端,使用 Marlin TP=4 達 50.5 tok/s。NVIDIA CUTLASS 核心在 SM120 初始化失敗,迫使 FP16 回退。MTP 效能倒退 22%。

Honor於MWC 2026開源MagicAgent。這是30B參數MoE代理基礎模型,用於進階任務規劃。專為異質協調設計。

Qwen 3.5 模型在 AA 非思考基準測試中表現出色,397B 在智慧指數獲 40 分,僅次於 GLM-5。27B 變體達 37 分,超越 Minimax M2 並匹配推理模型。較小 35B-A3B 獲 31 分,勝過近期 Deepseek R1。
社群要求的 Qwen3.5-35B-A3B 實驗證實 KV q8_0 量化提升吞吐量而不損品質。Q4_K_M 仍是最佳表現者,使用 --fit 達 74.7 tok/s。KL 散度顯示 UD-Q4_K_XL 表現明顯較差。

Liquid AI 發布 LFM2-24B-A2B,其最大稀疏 MoE 模型,總參數 24B、每 token 活躍 2B。支援 32GB RAM 推理,使用 llama.cpp、vLLM。開放權重於 Hugging Face 提供 GGUF 量化。