
KNOWPLAN 將課程目錄挖掘與學位規劃分離
KNOWPLAN 提出雙階段 AI agent 系統,先從異質的官方來源重建大學課程架構,再最佳化個人化學位路徑。其「先擷取、後規劃」設計達到 96.2% 的目錄完整度召回率,減少 47% 的來源存取量,並在評估中維持 100% 硬性可行性。
Tag: #agentic-systems27 results

KNOWPLAN 提出雙階段 AI agent 系統,先從異質的官方來源重建大學課程架構,再最佳化個人化學位路徑。其「先擷取、後規劃」設計達到 96.2% 的目錄完整度召回率,減少 47% 的來源存取量,並在評估中維持 100% 硬性可行性。

ViSAGE 是一套用於長篇影片理解的多模態代理記憶框架,能建立以實體為中心且可自我修正的記憶。它透過提升身份一致性與證據驗證能力,較最強基準模型取得高出 5.9% 的準確率。

隨著組織轉向代理人 AI 系統,IT 領導者必須重新評估其架構基礎以確保長期可擴展性。本文強調專注於核心基礎設施要素,以減輕技術快速演進帶來的風險。

本研究為代理系統引入了一套策略性決策支援框架,旨在最小化支援使用率的同時控制錯誤率。該研究提供了一種數學方法,用以決定 AI 代理何時應尋求人類或工具的介入。
對 AI 安全評估不現實的批評忽略了真實部署使用更失控的設定,如代理編碼中的高壓 Ralph Wiggum 迴圈和高壓系統提示。範例包括無監督過夜運行、敦促成功且無護欄,以及 Gemini CLI 的 token 限制警告。這主張需測試更廣泛的部署風險。

這篇 arXiv 論文提出使用 DEVS 形式化,從自然語言規格透過分階段 LLM 管線生成離散事件世界模型。方法將結構推斷與事件及時序邏輯分離,針對如排隊、具身規劃及多代理協調等環境。模型透過結構化事件追蹤對照時序與語義約束進行驗證,以確保可重現性。

研究人員提出使用RAG的代理式LLM系統,自動化AML與KYC合規的負面媒體篩選,解決關鍵字搜尋的高假陽性率。LLM代理執行網路搜尋、擷取與處理文件,並計算每個主體的負面媒體指數(AMI)分數。在來自OpenSanctions的PEP、受制裁人士及清白姓名資料集評估,顯示優異風險區分能力。

Vercel 強調編碼代理執行生成程式碼並擁有完整存取機密的風險,易受提示注入攻擊,如從日誌中竊取憑證。代理系統有四個行為者——代理、韁繩、機密、基礎設施——每個需要不同的信任等級與安全邊界。建議分離上下文而非共享存取權。

亞馬遜分享代理式 AI 系統的全面評估框架,應對應用複雜性。核心元件包含通用評估工作流程,標準化跨代理的評估程序,以及 Bedrock AgentCore Evaluations 中的評估庫。同時涵蓋亞馬遜特定使用案例指標。
實驗自動化代理(EAA)是一款視覺語言模型驅動的系統,用於自動化材料表徵中的複雜顯微鏡工作流程。它結合多模態推理、工具動作及長期記憶,支持自主或使用者引導實驗。在先進光子源展示,包括對焦、特徵搜尋及資料擷取,提升效率。