Search

Tag: #moe-architecture6 results

Qwen 3.5 397B Beats Trillion-Param Rival Cheaply

Qwen 3.5 397B Beats Trillion-Param Rival Cheaply

Alibaba launched Qwen3.5-397B-A17B, an open-weight MoE model with 397B total parameters but only 17B active per token, outperforming its trillion-parameter Qwen3-Max on benchmarks. It offers 19x faster decoding at 256K context, 60% lower running costs, and native multimodal capabilities from scratch training on text, images, and video. The hosted version supports up to 1M tokens.

Alibaba Launches Qwen3.5 Multimodal VLM

Alibaba Launches Qwen3.5 Multimodal VLM

Alibaba has introduced the open-source Qwen3.5 series designed for native multimodal agents. The inaugural model is a ~400B parameter vision-language model (VLM) featuring reasoning capabilities via a hybrid mixture-of-experts (MoE) and Gated Delta Networks architecture. It excels in understanding and navigating user interfaces, surpassing previous VLMs.

NVIDIA Developer BlogOfficialFeb 27#multimodal-agents#vision-language#moe-architecture