⚛️較早收集於 61m

SaaS-Bench 揭示 Claude 在辦公任務中的低通過率

SaaS-Bench 揭示 Claude 在辦公任務中的低通過率
PostLinkedIn
⚛️閱讀原文: 量子位

💡SaaS-Bench 揭露了 AI Agent 炒作與現實的差距,真實辦公任務通過率不足 4%。

⚡ 30-Second TL;DR

有什麼變化

SaaS-Bench 專門評估大模型在真實、多步驟辦公自動化任務中的表現。

為什麼重要

這項研究為開發 AI Agent 的開發者提供了現實檢視,表明目前的「電腦操作」能力尚不足以支撐企業級的自動化需求。

下一步行動

在複雜任務的評測通過率顯著提升之前,請務必在 Agent 工作流中加入人工驗證機制。

誰應關注:Developers & AI Engineers

關鍵要點

  • SaaS-Bench 專門評估大模型在真實、多步驟辦公自動化任務中的表現。
  • 包括 Claude 在內的主流模型,完全通過率最高僅為 3.8%。
  • 該評測挑戰了當前業界對於「Computer-Use」能力的過度炒作。
  • AI Agent 在處理複雜、長週期的辦公工作流時仍面臨巨大挑戰。

🧠 深度解析

Web-grounded analysis with 21 cited sources.

🔑 增強重點摘要

  • SaaS-Bench 評測包含 106 項任務,涵蓋 23 個 SaaS 系統和 6 個專業領域,特別強調跨應用程式協調和長週期執行的真實專業工作流程,而非孤立的短期網路互動。
  • 該基準測試包括 74 項純文字任務和 32 項多模態任務,其中多模態任務主要集中在自然依賴圖像、文件或媒體資產的農業和媒體等領域。
  • UniPat AI 的使命是透過在現實情境中訓練 AI,以產生可泛化且具經濟影響力的智慧,從而加速 AI 向現實世界自動化演進。
  • 「電腦使用代理」(Computer-Use Agents)是一種新興的 AI 系統,能夠感知電腦螢幕、理解圖形使用者介面(GUI),並像人類一樣執行任務,旨在解決大多數 AI 模型無法觸及的「長尾」數位使用案例。
  • 儘管電腦使用代理取得了進展,但它們尚未成熟到可以日常使用,面臨著泛化能力不足、學習效率低下、規劃能力有限以及基準測試中任務複雜度低等挑戰。
📊 競品分析▸ Show
模型/平台辦公自動化/代理性能編碼性能指令遵循上下文視窗價格 (每百萬 Token)備註
Claude Opus 4.6在 GDPval-AA (經濟價值知識工作任務) 上優於 GPT-5.2 約 144 Elo 點;在 BrowseComp (線上資訊搜尋) 上表現出色;擅長法律、金融、技術內容的多源分析。在內部基準測試中,對長週期任務和程式碼審查非常有效。卓越的多源分析和高推理任務。-輸入 $5 / 輸出 $25Anthropic 的旗艦模型,專為複雜推理和分析設計。
GPT-4.1在 MultiChallenge (多輪上下文管理) 中得分 38.3% (高於 GPT-4o 的 27.8%)。SWE-bench Verified (解決真實 GitHub 問題) 得分 54.6% (高於 GPT-4o 的 33.2%);程式碼差異準確度 52.9%。IFEval 合規性 (遵循明確指令) 87.4% (高於 GPT-4o 的 81.0%)。100 萬 Token輸入 $2 / 輸出 $8OpenAI 的模型,針對編碼、長上下文理解和指令遵循進行了優化。
Gemini 2.5 Pro在推理和事實核查的行業基準測試中領先;具有大型上下文視窗和多模態功能,支援更大的業務需求;與 Google Workspace 深度整合。在 Aider Polyglot 編碼編輯基準測試中領先。在「人類的最後一場考試」中表現出色,強調數學、科學、常識和邏輯推理。100 萬 Token輸入 $2 / 輸出 $12Google 的模型,在多個基準測試中表現出色,並具有實用的業務功能。
Gemini 3.5 Flash在 Zapier 的 AutomationBench 上排名第一,該基準測試旨在測試模型在銷售、行銷、營運、支援、財務和人力資源等領域完成真實業務工作流程的能力。專為複雜、長週期任務設計,可協助軟體開發、財務文件準備等。能夠可靠地處理混亂的工作流程、分支邏輯並在多個步驟中保持狀態。--Google 的最新 Flash 模型,強調代理能力和多步驟任務。
OpenAI Computer-Using Agent (CUA)在 OSWorld 的完整電腦使用任務中成功率為 38.1%;在 WebArena 中為 58.1%;在 WebVoyager 中為 87%。-結合 GPT-4o 的視覺能力和透過強化學習進行的高級推理。--透過感知原始像素資料和使用虛擬滑鼠鍵盤與 GUI 互動。

🛠️ 技術深入

  • SaaS-Bench 任務合成流程:採用迭代的「建構者-挑戰者-精煉者」循環來生成和實例化任務範本,並由專家執行和檢查任務軌跡,以確保任務驗證器的一致性、故障歸因和指令清晰度。
  • 電腦使用代理 (CUA) 機制:結合了 GPT-4o 的視覺能力和透過強化學習實現的高級推理。它處理原始像素資料以理解螢幕上發生的情況,並使用虛擬滑鼠和鍵盤執行操作。CUA 透過感知、推理和行動的迭代循環來運作。
  • Claude 的代理架構:包含「代理循環 (agentic loops)」、「多代理協調 (multi-agent orchestration)」、「Agent SDK」、「Claude Code 配置」、「結構化提取 (structured extraction)」和「模型上下文協議 (MCP) 整合」。
  • Claude 的上下文管理:旨在解決「中間遺失效應 (lost in the middle effect)」,並提供多種方法來減少上下文膨脹,包括在 Claude Code 中使用 /memory 功能。
  • Claude 的工具使用:可以透過電腦使用功能、MCP 連接器或瀏覽器擴充功能連接到外部工具。

🔮 前景展望AI analysis grounded in cited sources

AI 代理將需要更強大且標準化的評估基準,以反映真實世界、多步驟、跨應用程式的工作流程。
目前的基準測試通常缺乏評估代理在專業辦公任務中表現所需的複雜性和現實條件,SaaS-Bench 的發現突顯了這一點。
「電腦使用代理」的發展將把重點從僅限 API 的互動轉向基於 GUI 的感知和控制。
OpenAI 的 CUA 等模型旨在像人類一樣與圖形使用者介面 (GUI) 互動,使其能夠處理更廣泛的數位任務,而無需專門的 API。
企業將越來越多地採用在複雜、長週期代理任務中表現出色的 AI 模型,即使它們在通用基準測試中並非絕對「最佳」。
Zapier 的 AutomationBench 和 Anthropic 的 GDPval-AA 等基準測試側重於真實業務工作流程和具有經濟價值的知識工作,這表明市場對實用、可靠的自動化需求高於原始智慧分數。

時間線

2023-03-14
OpenAI 發布 GPT-4,一個大型多模態模型,在多項專業和學術基準測試中展現出人類水準的表現。
2025-01-23
OpenAI 推出電腦使用代理 (CUA),為 Operator 提供支援,該代理能夠感知電腦螢幕並像人類一樣執行任務。
2026-02-05
Anthropic 推出 Claude Opus 4.6,在 GDPval-AA 和 BrowseComp 等高推理任務中表現出色。
2026-03-12
Anthropic 推出 Claude 認證架構師基礎 (CCA-F) 認證計畫,涵蓋代理架構、工具設計和上下文管理。
2026-05-15
SaaS-Bench 評測論文在 arXiv 上發布,詳細介紹其方法論和任務組成。
2026-05-21
Gemini 3.5 Flash 在 Zapier 的 AutomationBench 上名列前茅,展示了在真實業務工作流程中的強大性能。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位