來源較早收集於 15h

Google 為 Gemini 3.5 Flash 加入電腦操作功能

閱讀原文: TestingCatalog
#autonomous-agents#ui-automation#safety-features

Gemini 3.5 Flash 現在可以控制您的桌面;了解如何建構能與任何應用程式互動的代理程式。

30 秒速覽

有什麼變化

Gemini 3.5 Flash 現已整合電腦操作功能

為什麼重要

這開啟了一類能夠執行複雜跨平台工作流程的自主代理程式。它顯著擴展了 Gemini 在企業自動化方面的效用。

下一步行動

查閱 Gemini API 文件,將新的電腦操作功能實作到您的代理工作流程中,並務必測試安全確認觸發機制。

誰應關注:Developers & AI Engineers

關鍵要點

  • •Gemini 3.5 Flash 現已整合電腦操作功能
  • •代理程式可跨瀏覽器、行動裝置與桌面執行任務
  • •包含強制性用戶確認與高風險任務的安全中止機制

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •Gemini 3.5 Flash 的電腦操作功能採用了多模態視覺處理技術,能即時解析螢幕像素並將其轉換為 UI 互動指令。
  • •該模型整合了 Google 的安全沙盒技術,在執行涉及系統設定變更或金融交易的操作前,會強制觸發人工驗證流程。
  • •此更新顯著降低了代理程式在處理複雜工作流程時的延遲,特別是在跨應用程式切換與資料同步的場景中。
  • •Google 針對此功能推出了專屬的開發者 API,允許企業將電腦操作能力嵌入自有的自動化工作流中。
  • •該功能目前支援在 Windows、macOS 及 Linux 環境下進行有限度的 GUI 自動化測試與任務執行。

競品分析

核心優勢
Gemini 3.5 Flash (Computer Use)
深度整合 Google 生態系與雲端資源
Anthropic Claude 3.5 Sonnet (Computer Use)
早期定義電腦操作標準,指令精準度高
OpenAI Operator
強大的推理能力與網頁自動化整合
部署方式
Gemini 3.5 Flash (Computer Use)
雲端 API 與邊緣運算混合
Anthropic Claude 3.5 Sonnet (Computer Use)
雲端 API
OpenAI Operator
雲端 API
安全機制
Gemini 3.5 Flash (Computer Use)
強制性用戶確認與沙盒隔離
Anthropic Claude 3.5 Sonnet (Computer Use)
嚴格的權限控管與使用限制
OpenAI Operator
逐步部署與行為監控

技術深入

  • 採用視覺感知層 (Visual Perception Layer) 來識別 UI 元素,無需依賴 DOM 結構即可操作應用程式。
  • 實作了基於螢幕截圖的座標映射系統,將模型輸出的點擊與輸入指令精確對應至作業系統的坐標系。
  • 內建行為分析引擎,用於偵測異常的滑鼠移動或重複性高風險指令,以防止惡意軟體行為。
  • 支援低延遲串流處理,使模型能以每秒數幀的速度觀察螢幕變化並做出反應。

前景展望基於引用來源的 AI 分析

企業自動化軟體市場將面臨重組
具備電腦操作能力的 AI 代理將直接取代傳統 RPA (機器人流程自動化) 工具,降低企業自動化部署的技術門檻。
作業系統介面設計將轉向 AI 優先
為了提升 AI 代理的操作效率,未來作業系統可能會引入更多 AI 友善的 API 介面,而非僅依賴視覺識別。

時間線

2024-12
Google 發布 Gemini 2.0 Flash,奠定高效能模型基礎
2025-05
Google I/O 大會展示 Gemini 代理程式的初步自動化能力
2026-03
Gemini 3.5 系列模型正式發布,提升多模態推理速度
2026-06
Gemini 3.5 Flash 正式整合電腦操作功能

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TestingCatalog ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。