Search

直接匹配不多,已補上最新動態。

Tag: #embodied-agents3 results

BeSafe-Bench 揭露 AI 代理安全風險

BeSafe-Bench 揭露 AI 代理安全風險

BeSafe-Bench 推出基準,用於評估情境 AI 代理在網頁、手機、具身 VLM 和 VLA 功能環境中的行為安全風險。它以九類安全關鍵風險擴充任務,並採用規則檢查與 LLM 作為評審的混合評估框架。對 13 個代理的測試顯示,即使最佳代理也僅能完全安全完成不到 40% 的任務,凸顯安全對齊的迫切需求。

LLM 踏入自主拳擊擂台

LLM 踏入自主拳擊擂台

一名開發者建立自主拳擊基準測試,用於評估 LLM 在即時壓力下的決策速度、適應力、策略、視覺能力與工具呼叫可靠性。初步使用 Gemini Flash Live 的測試顯示,速度快且具備視覺能力的模型能夠閃避及反擊,而較慢的本地模型可能需要時間縮放機制。

Reddit r/MachineLearningCommunityAug 3#embodied-agents#real-time-inference#agent-benchmarking
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。