
Meta 開源可本地運行的視覺智能體模型
Meta 開源了一款可在本地運行的智能體模型,支援視覺理解與工具調用。這項發布有望為開發者提供更易部署的多模態智能體基礎,降低對託管服務的完全依賴。
Tag: #multimodal-agents7 results

Meta 開源了一款可在本地運行的智能體模型,支援視覺理解與工具調用。這項發布有望為開發者提供更易部署的多模態智能體基礎,降低對託管服務的完全依賴。

DeepSeek Harness v0.1.1 新增 DeepSeek-V4-Flash-Vision-Exp 多模態視覺理解模型的 adapter。此次發布也支援原生影像請求、在 /goal 與 /plan 等指令中輸入影像、透過 MCP/ACP 持續附加影像,以及在 PTC Mode 中轉送巢狀影像。

MMShopBench 是一套使用影像、對話與產品資料,評估多模態多輪購物代理的真實紀錄基準。研究同時提供離線購物沙盒與訓練集,顯示微調可大幅縮小開源模型與專有模型之間的效能差距。

研究人員推出了「證據導向多模態代理」(ECA) 框架,強制代理在執行特權操作前,必須先透過外部驗證器確認視覺聲明。此方法有效緩解了「幻覺轉化為行動」的問題,防止模型基於錯誤感知執行未經授權的任務。

提出UI-in-the-Loop (UILoop)範式,將GUI推理視為螢幕-UI元素-動作的循環過程,利用MLLMs提升UI元素理解。引入具三項評估指標的UI理解任務及26K樣本基準測試。於UI理解及GUI推理任務中達成SOTA表現。

阿里巴巴推出開源 Qwen3.5 系列,專為原生多模態代理設計。第一款模型為約 400B 參數的視覺語言模型 (VLM),採用混合專家混合 (MoE) 與 Gated Delta Networks 架構具備推理能力。它在理解與導航使用者介面方面優於前代 VLM。
AGB CLOUD提供安全沙盒,用於訓練理解螢幕及操作UI元素的多模態代理。同時支援文字、影像及網頁互動。