🇨🇳最新收集於 9h

Alibaba 推出 Qwen-UI-Agent 挑戰頂尖 GUI 模型

Alibaba 推出 Qwen-UI-Agent 挑戰頂尖 GUI 模型
PostLinkedIn
🇨🇳閱讀原文: cnBeta (Full RSS)
#gui-agent#mobile-automation#deepsearch#benchmarkqwen-ui-agentalibabaqwen-ui-agentopenaigpt-5.6claude-opus-4.8

💡Qwen-UI-Agent 瞄準真實螢幕操作,並據報在行動端任務中超越頂尖模型。

⚡ 30-Second TL;DR

有什麼變化

Qwen-UI-Agent 被定位為用於真實世界 GUI 智能體的基座模型。

為什麼重要

若行動端 GUI 基準表現穩健,可能加速能直接操作應用程式與網站、而非僅依賴 API 的智能體採用。開發者仍應在一致的提示詞、工具、延遲及任務完成標準下驗證這項比較,再投入生產環境。

下一步行動

建立一套小型行動應用程式任務集,並在相同截圖、工具權限及成功標準下,將 Qwen-UI-Agent 與目前的 GUI 智能體進行評測。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen-UI-Agent 被定位為用於真實世界 GUI 智能體的基座模型。
  • 模型涵蓋行動端、電腦端、網頁端及 DeepSearch 環境。
  • Alibaba 宣稱其在行動端基準測試中超越 GPT 5.6 與 Claude Opus 4.8。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 15 個來源。

🔑 增強重點摘要

  • Qwen-UI-Agent於2026年8月20日正式發布,被定位為一款以真實世界任務為核心的GUI智能體基座模型,旨在讓AI能直接看懂螢幕界面並模擬人類操作應用程式與軟體,充當數位設備的通用執行器。
  • 該模型在電腦端OSWorld-Verified基準測試中達到79.5%的成功率,超越了GPT-5.5和Gemini 3.1 Pro等模型。
  • Qwen-UI-Agent在瀏覽器與DeepSearch環境的WebArena基準測試中取得73.6%的成績,位列所有對比模型之首。
  • 模型內建了貫穿任務執行全過程的安全機制,對於違法或高風險請求會直接拒絕並終止任務,而對於支付、數據刪除、隱私授權等敏感操作,則會在關鍵步驟主動停止並向用戶說明情況,待獲得明確確認後才繼續執行。
  • Qwen-UI-Agent採用統一的動作空間,可將GUI操作與CLI(命令行界面)執行交錯進行,並能在單次決策中批量輸出多個動作,在電腦任務中約有40%的動作以批量形式輸出,顯著提升效率。
📊 競品分析▸ Show
特性/模型Qwen-UI-Agent (阿里巴巴)GPT 5.6 Sol (OpenAI)Claude Opus 4.8 (Anthropic)Gemini 3.1 Pro (Google)GPT-5.5 (OpenAI)Seed 2.1 Pro
發布日期2026年8月20日2026年5月28日 (Opus 4.8)2026年5月28日---
模型類型GUI智能體基座模型旗艦大型語言模型 (具備Agentic能力)旗艦大型語言模型 (具備Agentic能力)旗艦大型語言模型 (具備Agentic能力)大型語言模型 (具備Agentic能力)GUI專用模型
覆蓋環境行動端、電腦端、網頁端、DeepSearch電腦使用、瀏覽器Agent任務電腦使用、瀏覽器Agent任務---
MobileWorld基準82.1%70.1% (落後12.0%)67.5% (落後14.6%)--73.2% (落後8.9%)
MobileWorld-Real基準 (真機)92.2%被超越被超越被超越-被超越
AndroidDaily基準97.5%被超越被超越被超越-被超越
OSWorld-Verified基準 (電腦端)79.5%--被超越被超越被超越
WebArena基準 (瀏覽器/DeepSearch)73.6% (位列第一)-----
GUI Grounding (ScreenSpot-Pro)81.5% (刷新SOTA)-----
主要功能GUI+CLI混合操作、批量動作、真機訓練、安全機制、跨設備任務接力、主動服務Agentic編碼、多檔案調試、長程自主任務、工具調用可靠性Agentic編碼、多檔案調試、長程自主任務、工具調用可靠性---
價格 (輸入/輸出)(Qwen 3.7 Plus約為$0.4/$1.6 每1M tokens)$5/$25 每1M tokens (Opus 4.8)$5/$25 每1M tokens---

🛠️ 技術深入

  • Qwen-UI-Agent是一個27B參數的模型,其技術報告已在arXiv上發布(論文ID: 2607.28227)。
  • 模型結合了多樣化的沙盒環境與大規模的真實設備行動運行時,該運行時包含超過100台真實手機和150多款應用程式,用於任務構建、軌跡採集、模型訓練與評測。
  • 其統一的動作空間能夠交錯執行GUI操作與CLI(命令行界面)命令,並在單一模型回合中生成批量動作,例如在電腦任務中,近一半(約40%)的動作以批量形式輸出。
  • 採用AutoResearch風格的數據飛輪機制,利用智能體自動構建任務和環境、診斷故障,並規劃後續的迭代。
  • 支援線上強化學習(Online RL),可在超過100步的超長軌跡上進行訓練,並配合約10,000個併發環境同時進行rollout,以持續攻克長程任務。
  • 透過輕量級的Harness框架,模型具備主動服務能力,並支援手機與電腦之間的跨設備任務接力,還能與DeepSearch深度搜尋功能聯動,結合網頁檢索與界面操作。
  • 模型設計目標是解決大量沒有開放API的傳統軟體應用,使其無需改造程序,AI即可透過理解螢幕界面完成操作。

🔮 前景展望AI analysis grounded in cited sources

GUI智能體將加速傳統軟體應用的自動化轉型。
Qwen-UI-Agent能夠在無需API的情況下,透過理解螢幕界面來操作傳統軟體,大幅擴展了自動化的應用邊界,預計將推動更多非API驅動軟體的智能化。
跨平台、多模態的AI智能體將成為個人數位助理的新標準。
Qwen-UI-Agent支援行動端、電腦端、網頁端及深度搜尋環境,並能進行跨設備任務接力,預示著未來個人數位助理將提供更統一、智慧且無縫的跨裝置體驗。
AI智能體的安全性與倫理考量將成為其大規模部署的關鍵因素。
Qwen-UI-Agent內建的安全機制,如拒絕高風險請求和敏感操作需用戶確認,顯示了業界對智能體可信賴性的重視,這將是未來AI智能體普及的基礎。

時間線

2014-XX
阿里巴巴成立iDST研究院,啟動人工智能核心技術研發。
2017-10
阿里巴巴集團達摩院正式成立,專注於前沿科技研究。
2023-04-07
阿里巴巴雲宣布通義千問(Tongyi Qianwen)對受邀企業用戶開啟內測,正式進入大語言模型領域。
2023-09-13
阿里雲宣布通義千問正式向社會公眾開放使用。
2025-04-29
阿里巴巴發布新一代模型Qwen3並宣布開源,涵蓋多種參數規模和模型類型。
2026-08-20
阿里巴巴正式推出Qwen-UI-Agent,一款以真實世界任務為核心的GUI智能體基座模型。

📎 來源 (15)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. cnbeta.com.tw
  2. ifeng.com
  3. sina.com.cn
  4. mydrivers.com
  5. arxiv.org
  6. ithome.com
  7. arxiv.org
  8. youtube.com
  9. lumichats.com
  10. roboflow.com
  11. 163.com
  12. huggingface.co
  13. themoonlight.io
  14. wikipedia.org
  15. wikipedia.org
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: cnBeta (Full RSS)

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。