
本地編碼模型達到2025雲端SOTA水準
開源27B-32B模型在Terminal-Bench 2.0上測試,Qwen 3.6-27B在預設超時下得分38.2%。此表現相當於2025年底的雲端前沿模型如Claude Opus 4.1。MOE模型推理速度大幅提升。
Tag: #moe-models14 results

開源27B-32B模型在Terminal-Bench 2.0上測試,Qwen 3.6-27B在預設超時下得分38.2%。此表現相當於2025年底的雲端前沿模型如Claude Opus 4.1。MOE模型推理速度大幅提升。
智源 Flag OS 社群宣布完成 Alibaba Qwen3.8-2.4T-A95B 在九款 AI 晶片上的 Day0 適配、精度對齊與部署驗證。新版本支援 BF16、FP8 與 INT8,讓開發者能在多種國產與主流 AI 硬體上快速部署這款 2.4T 參數 MoE 模型。
使用 llama-bench 以 Q4_K_M 量化,在 MacBook Air M5 32GB 上全面基準測試 37 款 LLM。強調 MoE 模型如 Qwen 3.5 35B-A3B 達 31 tok/s 為頂尖效能。分享開源工具供社群硬體基準測試。
Gemma 4 是首個在使用者英語、德語、日語多語言工具呼叫測試中達 100% 成功率的 LLM。用於 N8N 語音助理,搭配 68GB VRAM 及 MoE 模型如 Gemma4 26BA4B。

Cursor的Composer 2透過Fireworks AI使用Moonshot開源的Kimi K2.5模型,引發中國AI供應鏈討論。DeepSeek和Kimi模型日益成為全球應用如OpenClaw代理的基礎。此轉變類似製造供應鏈,Token成為新基礎設施。
詳細剖析中國 LLM 生態,ByteDance 的 Doubao 為專有領導者,Alibaba 的 Qwen 在開源權重模型表現出色。Deepseek 以 MLA 等技術創新,「六小虎」如 Zhipu 和 Minimax 發布大型開源 MoE 模型提供廉價推理。Meituan 積極推出如 562B LongCat-Flash。

DeepSeek 宣布 V4 多模態模型將優先使用國產晶片,首次實現全流程非 Nvidia 方案。中國公司轉向混合專家模型等演算法優化,大幅降低成本,並推進國產晶片用於訓練。這標誌從推理到完整訓練的轉變。

AWS 在 vLLM 中實現了 Mixture of Experts (MoE) 模型的多 LoRA 推論,包括核心層級優化。此功能可在 Amazon SageMaker AI 和 Amazon Bedrock 上高效服務數十個微調模型。以 GPT-OSS 20B 作為主要範例。
基準測試 Google 新 Gemma4 對 Alibaba 的 Qwen3.5,在 RTX 4090 上進行本地代理編碼。Qwen3.5-27B 在程式碼品質、可靠性和效率上表現出色,儘管速度較慢。MoE 變體如 Gemma4-26B 較快但複雜任務準確度較低。

在 Ryzen 7600X 上對 V100 32GB GPU 進行 20 個 LLM 模型(MoE 與密集型)的 6 小時基準測試,涵蓋 300W-150W 功率限制與 CPU 卸載層級,最高達 32K 上下文。功率限制至 200W 生成僅損失 <2%;MoE 模型遠優於密集型處理卸載。頂尖表現:Nemotron-30B Mamba2 達 152 t/s。