
以 SkillEvaluator 衡量 AI Agent 技能表現
NVIDIA SkillEvaluator 用於衡量封裝後的 agent skills 是否能改善 AI agent 的表現。它評估指令、範例與工具指南的價值,協助 agent 找到相關上下文、減少無效步驟,更有效完成專業任務。
Tag: #context-engineering12 results

NVIDIA SkillEvaluator 用於衡量封裝後的 agent skills 是否能改善 AI agent 的表現。它評估指令、範例與工具指南的價值,協助 agent 找到相關上下文、減少無效步驟,更有效完成專業任務。

阿里推出 MyContext,作為企業 Agent 的資料加工層。該產品旨在將 DingTalk 聊天、企業文件與工作資料納入 Agent 的上下文。

Tencent 推出 Team Memory Beta,這是一套開源系統,讓多個 AI Agent 存取具權限控管的共享記憶,而非各自維護孤立上下文。系統支援聊天記憶、版本化技能、文件型 LLM-Wiki 頁面與程式碼圖譜,但如何治理共享記憶中的錯誤資訊仍未解決。

SageOX 以 1500 萬美元種子輪融資從隱身模式現身,推出代理上下文基礎設施,解決 AI 代理的上下文工程問題。此系統使用 Ox Dot 硬體並整合 Slack、電子郵件和文件,捕捉團隊討論並讓代理與任務保持一致。由 AWS 老將創立,它確保代理像人類員工一樣「隨時掌握」資訊。

韁具工程優化AI代理的工具、提示與上下文,提升效能,LangChain的GPT-5.2-Codex代理在Terminal Bench 2.0從52.8升至66.5。建基於上下文工程,包括KV快取、漸進披露、自我驗證與長時架構。

本文探討了 Model Context Protocol (MCP) 工具設計中常見的錯誤。它提供了有效的上下文工程實踐策略,以提升模型效能。

Salesforce 更新 Agentforce Vibes 至 2.0 版本,針對 AI 代理在複雜工作流程中因上下文過載導致的失敗問題。新功能包括支援如 ReAct 等第三方框架,以及 Abilities 和 Skills 來引導代理行為。這幫助像 VentureCrowd 這樣的企業克服資料與上下文問題,將開發週期縮短 90%。

Cursor 開發商 Anysphere 公開技術支援團隊使用 Cursor 精簡業務的具體手法。此方法使支援工程師產出提升 5~10 倍,特別適用於障害調查。重點在高效上下文收集,避免調查挫折。

被譽為「HBM 之父」的韓國學者金正浩指出,AI 計算主導權正從 GPU 加速轉向記憶體。隨著 AI 從生成式邁向智能體(Agentic AI)時代,記憶體成為發展關鍵瓶頸。這一轉變的核心在於「上下文工程」的興起,需要同時處理海量文件、影片及多模態資料。

InfoQ 中國探討 AI 如何改變故障處理流程。文章強調,複雜且模糊的故障仍需要人類判斷與介入。