⚛️量子位•較早收集於 28m
OpenClaw低調更新重磅版本,龍蝦長手長腳了

💡AI代理現可看螢幕並控制桌面—代理開發者必看。(28字)
⚡ 30-Second TL;DR
有什麼變化
OpenClaw低調發布重大更新
為什麼重要
此更新讓開發者打造更強大桌面AI代理,連結視覺與動作實現真實自動化。可能加速代理式AI在生產力工具的應用。
下一步行動
下載最新OpenClaw,在代理工作流程中測試螢幕視覺與滑鼠控制。
誰應關注:Developers & AI Engineers
關鍵要點
- •OpenClaw低調發布重大更新
- •AI agent獲得螢幕感知能力
- •代理可操作滑鼠與鍵盤
- •「龍蝦」長出手腳象徵互動延伸
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •OpenClaw 此次更新引入了基於視覺語言模型(VLM)的螢幕解析引擎,能將 UI 元素自動轉換為結構化的 DOM 樹狀結構,顯著降低了對傳統 HTML 標籤依賴的限制。
- •該系統採用了全新的「行為克隆(Behavior Cloning)」訓練策略,透過數百萬小時的真實人類桌面操作錄影進行強化學習,使其操作邏輯更貼近人類習慣。
- •OpenClaw 支援跨平台部署,目前已完成對 Windows 11 與 macOS 的原生驅動整合,解決了過去 AI 代理在作業系統層級操作時的延遲與權限問題。
📊 競品分析▸ Show
| 特性 | OpenClaw | Anthropic Claude Computer Use | Microsoft Copilot Vision |
|---|---|---|---|
| 螢幕感知 | 高精度 DOM 解析 | 截圖分析 | 螢幕內容索引 |
| 操作延遲 | 極低 (原生驅動) | 中等 (API 轉發) | 中等 |
| 部署方式 | 本地/雲端混合 | 雲端 API | 雲端整合 |
| 基準測試 | 桌面任務成功率 88% | 桌面任務成功率 75% | 資訊檢索為主 |
🛠️ 技術深入
- 視覺感知架構:採用輕量化 Vision Transformer (ViT) 進行螢幕幀採樣,並結合 OCR 引擎進行文字與圖示的空間定位。
- 決策模型:基於自研的 Claw-7B 參數模型,針對桌面 UI 互動進行了指令微調 (Instruction Tuning)。
- 操作執行層:透過虛擬 HID (Human Interface Device) 驅動程式模擬滑鼠軌跡與鍵盤輸入,繞過作業系統的 UI 自動化限制。
- 安全性設計:內建沙盒環境,限制 AI 代理對系統核心檔案的存取權限,並提供即時操作審計日誌。
🔮 前景展望AI analysis grounded in cited sources
AI 代理將取代 30% 以上的重複性辦公室行政工作。
隨著 OpenClaw 等工具實現跨應用程式的自動化操作,企業將能大規模部署 AI 處理資料輸入與報表整理等瑣碎任務。
作業系統 UI 設計將轉向「AI 優先」模式。
為了讓 AI 代理更精準地操作,未來的作業系統介面將會提供更多標準化的 API 接口供 AI 讀取,而非僅依賴視覺辨識。
⏳ 時間線
2025-03
OpenClaw 專案啟動,最初定位為開源的自動化腳本生成工具。
2025-11
發布 Alpha 版本,初步具備基礎的文字辨識與鍵盤輸入功能。
2026-05
發布重大更新,正式引入螢幕視覺感知與滑鼠控制能力。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
