🏠IT之家•較早收集於 8h
阿里千問開源 Qwen3.5 小尺寸模型

💡0.8B-9B 小模型開源,媲美巨型模型滿足邊端/伺服器 AI。(26字元)
⚡ 30-Second TL;DR
有什麼變化
Qwen3.5-0.8B/2B:極致輕量,適合邊端/IoT 部署
為什麼重要
讓高效 AI 普及於資源受限應用,加速邊端 AI 與 Agent 開發。
下一步行動
從 Hugging Face 下載 Qwen3.5-0.8B 並於邊端硬體基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen3.5-0.8B/2B:極致輕量,適合邊端/IoT 部署
- •Qwen3.5-4B:輕量 Agent 強大基座
- •Qwen3.5-9B:緊湊尺寸媲美 GPT-4o 效能
- •原生多模態訓練與最新模型架構
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Qwen3.5 系列採用混合專家(MoE)架構,例如 397B 總參數僅激活 17B,提升解碼速度達 8.6 倍至 19 倍,相較前代 Qwen3-Max。
- •支援高解析度視覺理解最高達 1344x1344 像素、像素級 UI 元素偵測,以及影片理解基準如 VideoMME 達 87.5%。
- •中等模型如 Qwen3.5-35B-A3B 僅激活 3B 參數,即超越前代 Qwen3-235B-A22B,在代理基準如 BFCL-V4 達 72.2。
- •所有模型以 Apache 2.0 授權開源於 Hugging Face、ModelScope 等平台,無使用限制可自由微調與商業部署。
- •上下文長度達 262,144 令牌,可透過 YaRN 擴展至 1M,並支援多語言數學與指令遵循基準。
📊 競品分析▸ Show
| 模型 | 參數 (總/激活) | 基準亮點 | 定價/可用性 |
|---|---|---|---|
| Qwen3.5-35B-A3B | 35B/3B (MoE) | 超越 Qwen3-235B-A22B;SWE-bench 72.4 (與 GPT-5 mini 並列) | Apache 2.0 開源免費 |
| Qwen3.5-27B | 27B (稠密) | MMLU-Pro 86.7;BFCL-V4 72.2 | Apache 2.0 開源免費 |
| Qwen3.5-122B-A10B | 122B/10B (MoE) | MMMU-Pro 76.9;Terminal-Bench 2 49.4 | Apache 2.0 開源免費 |
| GPT-5 mini | 未公開 | SWE-bench Verified 72.4 (與 Qwen3.5-27B 並列) | 閉源付費 API |
🛠️ 技術深入
- •架構:混合 MoE 與 Gated Delta Networks,例如 Qwen3.5-397B 總 397B 參數、每 token 激活 17B;Qwen3.5-35B-A3B 使用 256 專家,每 token 路由 8 專家加 1 共享專家。
- •上下文:原生 262,144 令牌(256K),可經 YaRN RoPE 擴展至 1M;詞彙 248,320 令牌。
- •多模態:早期融合訓練文字、影像、UI 截圖;視覺解析度最高 1344x1344 像素,支援像素級 grounding 與影片理解。
- •訓練優化:異質基礎設施並行訓練視覺與語言;非同步強化學習使用 FP8 壓縮與推測解碼,加速 3-5 倍。
- •推理:多令牌預測(MTP)提升吞吐量;支援 GGUF 量化於 8GB VRAM GPU 運行。
🔮 前景展望AI analysis grounded in cited sources
Qwen3.5 小模型將加速邊端多模態 AI 部署
其輕量 MoE 設計與開源授權降低硬體門檻,適用 IoT 與行動裝置,推動代理應用普及。
開源 MoE 將挑戰閉源巨型模型主導
小尺寸模型媲美 GPT-4o 效能且免費微調,預期吸引開發者轉向阿里生態,擴大市場份額。
NVIDIA NeMo 整合提升企業自訂化
支援 LoRA 與多節點訓練,讓 Qwen3.5 快速適應領域任務如醫療視覺 QA。
⏳ 時間線
2026-02
發布 Qwen3.5 中等模型系列,包括 35B-A3B、27B、122B-A10B
2026-02-24
Qwen 團隊正式發布 Qwen3.5 中等模型系列於 Hugging Face 等平台
2026-03-02
開源 Qwen3.5 小尺寸模型 0.8B、2B、4B、9B,擴展家族全系列
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- datacamp.com — Qwen3 5
- techcommunity.microsoft.com — 4498640
- digitalapplied.com — Qwen 3 5 Medium Model Series Benchmarks Pricing Guide
- together.ai — Qwen3 5 397b A17b
- developer.nvidia.com — Develop Native Multimodal Agents with Qwen3 5 Vlm Using Nvidia GPU Accelerated Endpoints
- qwen.ai — Blog
- GitHub — Qwen3
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家 ↗
每週 AI 簡報
每週一封,可隨時退訂。



