
Qwen 3.5 397B 以低成本擊敗萬億參數模型
阿里巴巴推出 Qwen3.5-397B-A17B,這款開源權重 MoE 模型擁有 3970 億總參數,但每 token 僅激活 170 億,基準測試超越自家萬億參數 Qwen3-Max。它在 256K 上下文長度下解碼速度快 19 倍,運行成本降低 60%,並從頭訓練具備原生多模態能力,涵蓋文字、圖像與影片。託管版本支援高達 100 萬 token。
Tag: #moe-architecture6 results

阿里巴巴推出 Qwen3.5-397B-A17B,這款開源權重 MoE 模型擁有 3970 億總參數,但每 token 僅激活 170 億,基準測試超越自家萬億參數 Qwen3-Max。它在 256K 上下文長度下解碼速度快 19 倍,運行成本降低 60%,並從頭訓練具備原生多模態能力,涵蓋文字、圖像與影片。託管版本支援高達 100 萬 token。

阿里開源三款新 Qwen3.5 模型:Qwen3.5-35B-A3B、Qwen3.5-122B-A10B 及 Qwen3.5-27B,在多榜單超越更大前代及 GPT-5 mini。這些 MoE 與密集模型可在消費級顯卡運行,Qwen3.5-Flash 上線阿里雲,每百萬輸入 Token 僅 0.2 元。擅長 Agent 任務、程式設計、數學及多模態推理。

阿里巴巴推出開源 Qwen3.5 系列,專為原生多模態代理設計。第一款模型為約 400B 參數的視覺語言模型 (VLM),採用混合專家混合 (MoE) 與 Gated Delta Networks 架構具備推理能力。它在理解與導航使用者介面方面優於前代 VLM。

印度 AI 實驗室 Sarvam 發布兩款從零構建的 MoE LLM:30B-A1B 適用低延遲應用,105B-A9B 適用嚴苛任務。模型即將在 Hugging Face 以開源權重提供,並支援 API 存取。105B 模型在印度語言基準優於 Gemini 2.5 Flash,多數基準優於 DeepSeek R1。
一年前,DeepSeek R1 以 671B 參數 MoE 架構推出。今天,26B 的 Gemma 4 MoE 雖然小 25 倍,卻表現驚人。貼文對本地 LLM 未來充滿期待。
使用者批評過時的 MythoMax 在 NSFW 角色扮演建構緩慢。尋求能在 2-3 訊息內啟動 NSFW 對話的模型,用於多樣情境。詢問 MOE 架構、頂尖角色扮演排名及 LLM 協調器。