🇨🇳cnBeta (Full RSS)•最新收集於 9h
Alibaba 推出 Qwen-UI-Agent 挑戰頂尖 GUI 模型

#gui-agent#mobile-automation#deepsearch#benchmarkqwen-ui-agentalibabaqwen-ui-agentopenaigpt-5.6claude-opus-4.8
💡Qwen-UI-Agent 瞄準真實螢幕操作,並據報在行動端任務中超越頂尖模型。
⚡ 30-Second TL;DR
有什麼變化
Qwen-UI-Agent 被定位為用於真實世界 GUI 智能體的基座模型。
為什麼重要
若行動端 GUI 基準表現穩健,可能加速能直接操作應用程式與網站、而非僅依賴 API 的智能體採用。開發者仍應在一致的提示詞、工具、延遲及任務完成標準下驗證這項比較,再投入生產環境。
下一步行動
建立一套小型行動應用程式任務集,並在相同截圖、工具權限及成功標準下,將 Qwen-UI-Agent 與目前的 GUI 智能體進行評測。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen-UI-Agent 被定位為用於真實世界 GUI 智能體的基座模型。
- •模型涵蓋行動端、電腦端、網頁端及 DeepSearch 環境。
- •Alibaba 宣稱其在行動端基準測試中超越 GPT 5.6 與 Claude Opus 4.8。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 15 個來源。
🔑 增強重點摘要
- •Qwen-UI-Agent於2026年8月20日正式發布,被定位為一款以真實世界任務為核心的GUI智能體基座模型,旨在讓AI能直接看懂螢幕界面並模擬人類操作應用程式與軟體,充當數位設備的通用執行器。
- •該模型在電腦端OSWorld-Verified基準測試中達到79.5%的成功率,超越了GPT-5.5和Gemini 3.1 Pro等模型。
- •Qwen-UI-Agent在瀏覽器與DeepSearch環境的WebArena基準測試中取得73.6%的成績,位列所有對比模型之首。
- •模型內建了貫穿任務執行全過程的安全機制,對於違法或高風險請求會直接拒絕並終止任務,而對於支付、數據刪除、隱私授權等敏感操作,則會在關鍵步驟主動停止並向用戶說明情況,待獲得明確確認後才繼續執行。
- •Qwen-UI-Agent採用統一的動作空間,可將GUI操作與CLI(命令行界面)執行交錯進行,並能在單次決策中批量輸出多個動作,在電腦任務中約有40%的動作以批量形式輸出,顯著提升效率。
📊 競品分析▸ Show
| 特性/模型 | Qwen-UI-Agent (阿里巴巴) | GPT 5.6 Sol (OpenAI) | Claude Opus 4.8 (Anthropic) | Gemini 3.1 Pro (Google) | GPT-5.5 (OpenAI) | Seed 2.1 Pro |
|---|---|---|---|---|---|---|
| 發布日期 | 2026年8月20日 | 2026年5月28日 (Opus 4.8) | 2026年5月28日 | - | - | - |
| 模型類型 | GUI智能體基座模型 | 旗艦大型語言模型 (具備Agentic能力) | 旗艦大型語言模型 (具備Agentic能力) | 旗艦大型語言模型 (具備Agentic能力) | 大型語言模型 (具備Agentic能力) | GUI專用模型 |
| 覆蓋環境 | 行動端、電腦端、網頁端、DeepSearch | 電腦使用、瀏覽器Agent任務 | 電腦使用、瀏覽器Agent任務 | - | - | - |
| MobileWorld基準 | 82.1% | 70.1% (落後12.0%) | 67.5% (落後14.6%) | - | - | 73.2% (落後8.9%) |
| MobileWorld-Real基準 (真機) | 92.2% | 被超越 | 被超越 | 被超越 | - | 被超越 |
| AndroidDaily基準 | 97.5% | 被超越 | 被超越 | 被超越 | - | 被超越 |
| OSWorld-Verified基準 (電腦端) | 79.5% | - | - | 被超越 | 被超越 | 被超越 |
| WebArena基準 (瀏覽器/DeepSearch) | 73.6% (位列第一) | - | - | - | - | - |
| GUI Grounding (ScreenSpot-Pro) | 81.5% (刷新SOTA) | - | - | - | - | - |
| 主要功能 | GUI+CLI混合操作、批量動作、真機訓練、安全機制、跨設備任務接力、主動服務 | Agentic編碼、多檔案調試、長程自主任務、工具調用可靠性 | Agentic編碼、多檔案調試、長程自主任務、工具調用可靠性 | - | - | - |
| 價格 (輸入/輸出) | (Qwen 3.7 Plus約為$0.4/$1.6 每1M tokens) | $5/$25 每1M tokens (Opus 4.8) | $5/$25 每1M tokens | - | - | - |
🛠️ 技術深入
- Qwen-UI-Agent是一個27B參數的模型,其技術報告已在arXiv上發布(論文ID: 2607.28227)。
- 模型結合了多樣化的沙盒環境與大規模的真實設備行動運行時,該運行時包含超過100台真實手機和150多款應用程式,用於任務構建、軌跡採集、模型訓練與評測。
- 其統一的動作空間能夠交錯執行GUI操作與CLI(命令行界面)命令,並在單一模型回合中生成批量動作,例如在電腦任務中,近一半(約40%)的動作以批量形式輸出。
- 採用AutoResearch風格的數據飛輪機制,利用智能體自動構建任務和環境、診斷故障,並規劃後續的迭代。
- 支援線上強化學習(Online RL),可在超過100步的超長軌跡上進行訓練,並配合約10,000個併發環境同時進行rollout,以持續攻克長程任務。
- 透過輕量級的Harness框架,模型具備主動服務能力,並支援手機與電腦之間的跨設備任務接力,還能與DeepSearch深度搜尋功能聯動,結合網頁檢索與界面操作。
- 模型設計目標是解決大量沒有開放API的傳統軟體應用,使其無需改造程序,AI即可透過理解螢幕界面完成操作。
🔮 前景展望AI analysis grounded in cited sources
GUI智能體將加速傳統軟體應用的自動化轉型。
Qwen-UI-Agent能夠在無需API的情況下,透過理解螢幕界面來操作傳統軟體,大幅擴展了自動化的應用邊界,預計將推動更多非API驅動軟體的智能化。
跨平台、多模態的AI智能體將成為個人數位助理的新標準。
Qwen-UI-Agent支援行動端、電腦端、網頁端及深度搜尋環境,並能進行跨設備任務接力,預示著未來個人數位助理將提供更統一、智慧且無縫的跨裝置體驗。
AI智能體的安全性與倫理考量將成為其大規模部署的關鍵因素。
Qwen-UI-Agent內建的安全機制,如拒絕高風險請求和敏感操作需用戶確認,顯示了業界對智能體可信賴性的重視,這將是未來AI智能體普及的基礎。
⏳ 時間線
2014-XX
阿里巴巴成立iDST研究院,啟動人工智能核心技術研發。
2017-10
阿里巴巴集團達摩院正式成立,專注於前沿科技研究。
2023-04-07
阿里巴巴雲宣布通義千問(Tongyi Qianwen)對受邀企業用戶開啟內測,正式進入大語言模型領域。
2023-09-13
阿里雲宣布通義千問正式向社會公眾開放使用。
2025-04-29
阿里巴巴發布新一代模型Qwen3並宣布開源,涵蓋多種參數規模和模型類型。
2026-08-20
阿里巴巴正式推出Qwen-UI-Agent,一款以真實世界任務為核心的GUI智能體基座模型。
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: cnBeta (Full RSS) ↗
每週 AI 簡報
每週一封,可隨時退訂。

