Search

Tag: #gui-agents13 results

GUI-Owl-1.5 稱霸 20 多項 GUI 基準

GUI-Owl-1.5 稱霸 20 多項 GUI 基準

GUI-Owl-1.5 推出多尺寸原生 GUI 代理模型(2B-235B),支援桌面、行動、瀏覽器平台,实现雲邊協作。它在 20 多項基準測試中創 SOTA,如 OSWorld 56.5、AndroidWorld 71.6、ScreenSpotPro 80.3。開源發布,創新包括數據飛輪、代理推理及多平台 RL。

ArXiv AIResearchFeb 20#gui-agents#multi-platform#rl-scaling
RiskWebWorld:電商風險管理真實GUI代理基準

RiskWebWorld:電商風險管理真實GUI代理基準

RiskWebWorld 是電商風險管理中 GUI 代理的第一個真實互動基準,包含來自 8 個領域生產管道的 1,513 個任務。它涵蓋不合作網站和部分環境劫持等挑戰,並提供 Gymnasium 相容基礎設施以支援可擴展評估與 RL。評估顯示頂級模型成功率 49.1%,強調基礎模型規模比零樣本介面 grounding 更重要。

ArXiv AIResearchApr 17#gui-agents#e-commerce#benchmark
基準測試讓行動GUI代理更人性化

基準測試讓行動GUI代理更人性化

引入「螢幕上的圖靈測試」基準,將代理偵測建模為MinMax最佳化,以最小化行為差異。收集高保真行動觸控動態資料集,揭示傳統LMM代理因不自然運動學易被偵測。建立AHB基準與指標,並提出人性化方法,在不損效能下實現高模仿度。

HyMEM 超強增強 GUI 代理

HyMEM 超強增強 GUI 代理

HyMEM 是用於 GUI 代理的圖形記憶系統,結合離散符號節點與連續軌跡嵌入,受人類記憶啟發。它支援多跳檢索、透過節點更新實現自進化,以及推理時的動態工作記憶刷新。實驗顯示它將 Qwen2.5-VL-7B 提升 +22.5%,匹敵或超越 Gemini 2.5 Pro Vision 和 GPT-4o。

ArXiv AIResearchMar 12#gui-agents#graph-memory#vlm-agents
ActionEngine:透過狀態機實現程式化 GUI 代理

ActionEngine:透過狀態機實現程式化 GUI 代理

ActionEngine 是一個無需訓練的框架,將 GUI 代理從反應式的逐步 LLM 呼叫轉向程式化規劃,採用雙代理架構。Crawling Agent 透過離線探索建構可更新的狀態機記憶,Execution Agent 則合成可執行的 Python 程式來完成任務。它在 WebArena Reddit 任務上達到 95% 成功率,只需單次 LLM 呼叫,即比基準線降低 11.8 倍成本與 2 倍延遲。

高效電腦使用代理的步驟級優化

高效電腦使用代理的步驟級優化

提出事件驅動的步驟級級聯框架,用於電腦使用代理,預設使用小型政策,僅在偵測到風險時升級至大型模型。包含停滯監控器偵測進度停滯,以及里程碑監控器捕捉長時程GUI任務中的語意偏移。模組化設計可無需重新訓練,直接層疊於現有代理。

LAMO:可擴展輕量GUI代理

LAMO:可擴展輕量GUI代理

LAMO框架透過多角色協奏賦予輕量MLLMs GUI自動化能力和任務可擴展性。它採用角色導向資料合成與兩階段訓練:Perplexity-Weighted Cross-Entropy監督微調用於知識蒸餾,以及RL用於合作探索。LAMO-3B支援單體與MAS執行,作為先進規劃器的即插即用執行器表現出色。

ArXiv AIResearchApr 17#gui-agents#lightweight-mllms
Page 1 of 2