
AWS 讓 AI 代理驅動 WorkSpaces
AWS 已推出 API,讓 AI 代理能互動並控制其 WorkSpaces 虛擬桌面。供應商基準測試顯示,這些 API 比其他方法更快且更便宜。然而,直接使用代理可能每次點擊耗費高達 500,000 個令牌。
直接匹配不多,已補上最新動態。
Tag: #cloud-apis1 results

AWS 已推出 API,讓 AI 代理能互動並控制其 WorkSpaces 虛擬桌面。供應商基準測試顯示,這些 API 比其他方法更快且更便宜。然而,直接使用代理可能每次點擊耗費高達 500,000 個令牌。
一項受控研究比較 EPMem 的二元邊緣遮罩更新,與凍結語言模型中的連續權重編輯,用於持續事實寫入。EPMem 能成功寫入事實,但遺忘速度相近甚至更快,顯示真正決定記憶保留的是配置規則,而非離散儲存本身。

Galbot 表示,其機器人在北京舉行的 World Humanoid Robot Games 中,與前世界排名第 15 的鄭潔完成超過 100 回合的連續自主網球對打。對打次數、自主運作說法及機器人身分尚未獲得獨立驗證,目前僅依據公司的說法。

Oren Etzioni 以白話解釋約 30 個常見 AI 術語,包括 LLM、open weights、RAG 與 agents。這份詞彙表也對每個術語提出直率評價,並介紹一個他認為應更廣泛使用的新詞組。

Forrester 報告指出,55% 的雇主後悔因 AI 而裁員,並預期一半歸因於 AI 的裁員將被悄悄逆轉。回流職位可能轉移至海外,或以大幅降低的薪資重新聘用;歐洲修訂後的指令則將要求企業在做出此類決策前進行諮詢,並面臨財務處罰。

據報導,人形機器人超越了 Usain Bolt 的 100 公尺賽跑紀錄。這些機器人的跑姿相當笨拙,凸顯速度基準與自然動作之間的差距。

一宗集體訴訟指控 Amazon 未取得 Twitch 實況主同意,便使用其內容訓練 AI 模型。此案將引發對 AI 訓練資料的所有權、授權與創作者權利的討論。

一名使用者比較 Qwen 3.8 27B 與 Claude Opus 5,測試將一個 39,000 行的 C 語言遊戲轉換成單一 HTML/three.js 檔案。Opus 在 21 分鐘內產出唯一達到可玩品質的結果,而兩個本地 Qwen harness 耗時 1 小時 40 分至 4 小時 18 分,產出的移植版本仍然損壞。

Swarms 的 GraphWorkflow 論文指出,在靜態 DAG 上,其編排速度相比 LangGraph 最快提升 62.5%,穩態幾何平均效能約提升 7 倍。文章認為,多 Agent 系統如今面對的核心工程挑戰,已不只是模型智慧,還包括編排、協調、共享狀態、失敗復原與成本控制。
AgentUptime 是一個早期概念,旨在獨立驗證 AI agent 聲稱完成的動作,是否真的產生預期的外部狀態。其提出的 receipt 層會將 agent 的成功訊息與實際檢查分離,例如讀回資料庫紀錄、確認 API 狀態,或驗證 agent handoff 是否成功。