🟩NVIDIA Developer Blog•較早收集於 30m
阿里巴巴推出 Qwen3.5 多模態 VLM

💡400B 開源 VLM 擅長 UI 導航—立即在 NVIDIA GPU 部署(28字元)
⚡ 30-Second TL;DR
有什麼變化
阿里巴巴發布開源 Qwen3.5 系列,用於原生多模態代理
為什麼重要
此開源發布為 AI 開發者提供大型多模態模型,無需專有依賴即可建構先進代理。與 NVIDIA 基礎設施整合降低可擴展應用部署門檻。
下一步行動
在 NVIDIA GPU 端點測試 Qwen3.5 VLM 以原型化 UI 導航代理。
誰應關注:Developers & AI Engineers
關鍵要點
- •阿里巴巴發布開源 Qwen3.5 系列,用於原生多模態代理
- •首發約 400B 參數 VLM 內建推理能力
- •混合 MoE 與 Gated Delta Networks 架構
- •UI 理解與導航優於前代 VLM
- •適用於 NVIDIA GPU 加速端點
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •Qwen3.5-397B-A17B 採用混合專家 (MoE) 架構,僅 17B 活躍參數,相比同級競品 (Kimi K2.5 32B、GLM-5 40B、DeepSeek V3.2 37B) 參數效率更高[2]
- •模型在 Artificial Analysis Intelligence Index 上獲得 45 分,相比前代 Qwen3 235B (29 分) 提升 16 點,GDPval-AA ELO 評分達 1,221,增幅 361 點,主要驅動力來自代理性能改進[2]
- •Qwen3.5 支援 262K tokens 上下文窗口,而託管版本 Qwen3.5-Plus 提供 1M tokens 上下文,內建官方工具整合[2][4]
- •模型在長上下文任務 (256k tokens) 解碼速度較 Qwen3-Max 快 19 倍,標準工作流快 8.6 倍,同時保持推理與編碼性能[1]
- •異步強化學習訓練方法結合 FP8 壓縮與推測解碼,使複雜代理技能 (如 UI 點擊、多步任務) 學習速度提升 3-5 倍[1]
📊 競品分析▸ Show
| 特性 | Qwen3.5-397B | Kimi K2.5 | GLM-5 | DeepSeek V3.2 |
|---|---|---|---|---|
| 總參數 | 397B | 1T | 744B | 671B |
| 活躍參數 | 17B | 32B | 40B | 37B |
| 上下文窗口 | 262K (託管版 1M) | 未明確 | 未明確 | 未明確 |
| Intelligence Index | 45 | 未明確 | 未明確 | 未明確 |
| GDPval-AA ELO | 1,221 | 未明確 | 未明確 | 未明確 |
| 輸出 Token 效率 | ~86M (Intelligence Index) | ~89M | ~110M | 未明確 |
🛠️ 技術深入
• 混合架構設計:視覺與語言部分分別訓練但同時進行,無需相互等待,訓練吞吐量接近 100%[1] • 多模態能力:支援視覺問答、文件理解、圖表/表格解釋,具備像素級接地能力以識別和互動螢幕元素[1] • 詞彙表優化:250K 詞彙表,複雜概念表達所需 tokens 更少,結合多 token 預測可降低 10-60% token 成本 (涵蓋 201 種語言)[1] • 推理與非推理模式:單一模型支援推理和非推理模式,與前代 Qwen3 系列 (分離的 instruct 和 thinking 變體) 相反[2] • FP8 壓縮與推測解碼:使用半精度位儲存數字,配合推測解碼實現非同步強化學習,加速代理技能習得[1]
🔮 前景展望AI analysis grounded in cited sources
MoE 架構的參數效率優勢將推動邊緣部署
17B 活躍參數相比競品少 50-88%,使 Qwen3.5 能在資源受限環境 (邊緣裝置、本地開發) 部署,擴大應用場景。
原生多模態代理能力將加速 UI 自動化產業化
像素級接地與 UI 導航優勢使自動化軟體測試、RPA、無代碼工作流等領域的商業化部署成為可行。
異步強化學習訓練方法將成為大模型訓練標準
3-5 倍加速且無品質損失的訓練方法可降低模型開發成本,預期其他廠商將採納類似技術。
⏳ 時間線
2024-11
阿里巴巴發布 Qwen3 系列,包含 Qwen3-Max 與 Qwen3-VL 等多個變體
2025-06
Qwen3-Coder-Next 發布,專為編碼代理與本地開發設計
2026-02
Qwen3.5 系列正式發布,首款模型為 Qwen3.5-397B-A17B,採用混合 MoE 架構與原生多模態能力
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。