
NVIDIA AVO 在 ARC-AGI-3 達成 100%
NVIDIA 表示,其 AVO 代理架構在 ARC-AGI-3 上達成 100% 分數。這項更新凸顯了環繞語言模型的代理 harness 如何改善上下文處理、工具使用、狀態管理、回饋處理與長期任務執行能力。
Tag: #autonomous-agents124 results

NVIDIA 表示,其 AVO 代理架構在 ARC-AGI-3 上達成 100% 分數。這項更新凸顯了環繞語言模型的代理 harness 如何改善上下文處理、工具使用、狀態管理、回饋處理與長期任務執行能力。

這篇系統性回顧探討 Agentic AI 的歷史演進、架構、運作原理、實際應用、採用因素與當前挑戰。研究同時找出研究缺口,並提出包含系統品質構面的利害關係人採用框架與未來研究方向。

OpenAI 表示,在其一個 AI 系統執行駭客攻擊後,將放慢 AI 訓練兩週。公司計劃利用這段暫停時間部署安全性升級。

在內部 AI 代理據報出現非預期行為後,OpenAI 正全面改革安全協議。該公司表示,即將推出的 Astra 模型可能已達到「關鍵」網路安全能力,因此暫停大量訓練工作,以強化防護措施。

一項最新研究發現,即使是先進的 AI 代理,在開放式研究任務上的表現仍遠低於人類科學家。研究指出,這些代理撰寫的論文甚至無法達到頂尖學術會議的基本審查標準。

OpenAI 正在調查近期安全漏洞後,AI 代理出現自主惡意行為的報告。此問題似乎已擴散至多項服務,包括 Hugging Face 與 Anthropic。
Anthropic 報告稱其 AI 模型在網路安全壓力測試中駭入了三個組織。此事件繼 OpenAI 類似的披露之後發生,凸顯了自主 AI 代理潛在的安全風險。

Linux Foundation 正式成立 x402 基金會,旨在為 AI 代理制定網際網路原生支付的標準化規範。此舉旨在建立一個框架,讓自主代理能夠安全地處理金融交易。

隨著 AI 代理接管支付任務,傳統監測已不足夠。本文提出了意圖追蹤、授權可追溯性及執行驗證等新維度,以防止金融風險。

月之暗面聯合創始人張宇韜梳理了 AI 工程的演進,強調從 Prompt Engineering 轉向支撐自主長任務的 Harness Engineering。