
MemTrace:評估 LLM 長期記憶準確度的新基準
MemTrace 是一個新的基準測試,透過關注「知識點」而非單一問題來評估 LLM 的長期記憶。研究顯示,記憶失敗的主要原因在於對證據的利用不佳,而非檢索能力不足。
Tag: #agentic-ai513 results

MemTrace 是一個新的基準測試,透過關注「知識點」而非單一問題來評估 LLM 的長期記憶。研究顯示,記憶失敗的主要原因在於對證據的利用不佳,而非檢索能力不足。
Salesforce 已同意以 36 億美元收購專注於 AI 客服代理的初創公司 Fin。此舉旨在增強 Salesforce 的企業級 AI 能力。

HOTE 框架引入了一種混合強化學習方法,用於進化開放式研究中的提議者、求解者和評判者模組。實驗顯示,經 HOTE 訓練的 8B 模型在長篇研究任務中表現優於更大的靜態模型。

華為在 HDC 2026 上宣布 HarmonyOS 的重大架構轉型,正式邁向以代理(Agent)為核心的作業系統。此轉變旨在將自主 AI 代理直接整合至系統核心,以提升用戶互動與自動化能力。

ByteDance 旗下豆包 AI 推出「任務模式」,支援網頁生成、PPT 製作與數據分析等自主工作流。同時,「思考模式」升級為搭載 Doubao 2.0 Pro 模型的「專家模式」。

Microsoft 推出了開源框架 SkillOpt,利用深度學習優化技術來改進 AI 代理技能,且無需修改模型權重。它將技能文件視為可訓練對象,解決了手動提示工程中不穩定且難以驗證的問題。
Visa 宣布與 OpenAI 達成戰略合作,將其全球支付網絡整合至 ChatGPT 平台。此合作將使 AI 代理在獲得用戶授權後,能獨立完成從商品搜尋到支付結帳的完整購物流程。
Agent-EvalKit 是一個新的開源工具包,旨在為 AI 代理提供結構化的評估基礎設施。它與 Claude Code 和 Kilo Code 等熱門編碼助手整合,簡化了跨六個不同階段的測試流程。

HERO 是一個全新的自我蒸餾框架,透過將環境觀察轉化為可執行的步驟級診斷回饋,提升多輪代理的效能。它解決了多輪設定中常見的效能下降問題,並將回饋與代理當前的決策情境進行對齊。

Apodex 發布了開源權重的「Smol」模型(0.8B、2B、4B),專為事實查核與工具基礎合成等子任務進行了優化。這些模型旨在透過將驗證任務從大型模型中卸載,來提高長程代理工作流程的效率。