🟩較早收集於 30m

阿里巴巴推出 Qwen3.5 多模態 VLM

阿里巴巴推出 Qwen3.5 多模態 VLM
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog

💡400B 開源 VLM 擅長 UI 導航—立即在 NVIDIA GPU 部署(28字元)

⚡ 30-Second TL;DR

有什麼變化

阿里巴巴發布開源 Qwen3.5 系列,用於原生多模態代理

為什麼重要

此開源發布為 AI 開發者提供大型多模態模型,無需專有依賴即可建構先進代理。與 NVIDIA 基礎設施整合降低可擴展應用部署門檻。

下一步行動

在 NVIDIA GPU 端點測試 Qwen3.5 VLM 以原型化 UI 導航代理。

誰應關注:Developers & AI Engineers

關鍵要點

  • 阿里巴巴發布開源 Qwen3.5 系列,用於原生多模態代理
  • 首發約 400B 參數 VLM 內建推理能力
  • 混合 MoE 與 Gated Delta Networks 架構
  • UI 理解與導航優於前代 VLM
  • 適用於 NVIDIA GPU 加速端點

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Qwen3.5-397B-A17B 採用混合專家 (MoE) 架構,僅 17B 活躍參數,相比同級競品 (Kimi K2.5 32B、GLM-5 40B、DeepSeek V3.2 37B) 參數效率更高[2]
  • 模型在 Artificial Analysis Intelligence Index 上獲得 45 分,相比前代 Qwen3 235B (29 分) 提升 16 點,GDPval-AA ELO 評分達 1,221,增幅 361 點,主要驅動力來自代理性能改進[2]
  • Qwen3.5 支援 262K tokens 上下文窗口,而託管版本 Qwen3.5-Plus 提供 1M tokens 上下文,內建官方工具整合[2][4]
  • 模型在長上下文任務 (256k tokens) 解碼速度較 Qwen3-Max 快 19 倍,標準工作流快 8.6 倍,同時保持推理與編碼性能[1]
  • 異步強化學習訓練方法結合 FP8 壓縮與推測解碼,使複雜代理技能 (如 UI 點擊、多步任務) 學習速度提升 3-5 倍[1]
📊 競品分析▸ Show
特性Qwen3.5-397BKimi K2.5GLM-5DeepSeek V3.2
總參數397B1T744B671B
活躍參數17B32B40B37B
上下文窗口262K (託管版 1M)未明確未明確未明確
Intelligence Index45未明確未明確未明確
GDPval-AA ELO1,221未明確未明確未明確
輸出 Token 效率~86M (Intelligence Index)~89M~110M未明確

🛠️ 技術深入

混合架構設計:視覺與語言部分分別訓練但同時進行,無需相互等待,訓練吞吐量接近 100%[1]多模態能力:支援視覺問答、文件理解、圖表/表格解釋,具備像素級接地能力以識別和互動螢幕元素[1]詞彙表優化:250K 詞彙表,複雜概念表達所需 tokens 更少,結合多 token 預測可降低 10-60% token 成本 (涵蓋 201 種語言)[1]推理與非推理模式:單一模型支援推理和非推理模式,與前代 Qwen3 系列 (分離的 instruct 和 thinking 變體) 相反[2]FP8 壓縮與推測解碼:使用半精度位儲存數字,配合推測解碼實現非同步強化學習,加速代理技能習得[1]

🔮 前景展望AI analysis grounded in cited sources

MoE 架構的參數效率優勢將推動邊緣部署
17B 活躍參數相比競品少 50-88%,使 Qwen3.5 能在資源受限環境 (邊緣裝置、本地開發) 部署,擴大應用場景。
原生多模態代理能力將加速 UI 自動化產業化
像素級接地與 UI 導航優勢使自動化軟體測試、RPA、無代碼工作流等領域的商業化部署成為可行。
異步強化學習訓練方法將成為大模型訓練標準
3-5 倍加速且無品質損失的訓練方法可降低模型開發成本,預期其他廠商將採納類似技術。

時間線

2024-11
阿里巴巴發布 Qwen3 系列,包含 Qwen3-Max 與 Qwen3-VL 等多個變體
2025-06
Qwen3-Coder-Next 發布,專為編碼代理與本地開發設計
2026-02
Qwen3.5 系列正式發布,首款模型為 Qwen3.5-397B-A17B,採用混合 MoE 架構與原生多模態能力
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。