
新型 GraphRAG 框架實現 LLM 代理與社會價值觀對齊
研究人員提出了一種基於 GraphRAG 的價值導向框架,將抽象原則轉化為 LLM 代理的可執行指令。該方法通過整合 Maslow's Hierarchy of Needs 等心理學理論,提升了代理在複雜困境中的決策能力。
Tag: #agentic-workflow156 results

研究人員提出了一種基於 GraphRAG 的價值導向框架,將抽象原則轉化為 LLM 代理的可執行指令。該方法通過整合 Maslow's Hierarchy of Needs 等心理學理論,提升了代理在複雜困境中的決策能力。

Raindrop AI 發布了開源且採用 MIT 授權的 Workshop 工具,讓開發者能在本地除錯與評估 AI Agent。該工具透過本地儀表板提供即時遙測數據,並將 Agent 的執行軌跡儲存於輕量級 SQL 資料庫檔案中。

騰訊已重組其 AI 組織並推出 Hy3 Preview 模型,專注於工程效率與實際應用效能,而非單純追求參數規模。騰訊正將 AI 整合至其生態系統,包括 WorkBuddy 與 CodeBuddy,同時大幅增加基礎設施投入。

Anthropic 在 Claude Code 中引入了「/goals」功能,將任務執行與評估分離。透過使用次要模型(Haiku)來驗證目標是否達成,有效防止代理程式過早結束任務。

Notion 推出全新的開發者平台,允許團隊將 AI Agent、外部資料來源及自訂程式碼直接整合至工作區中。此舉標誌著該公司正轉型為代理人式生產力軟體的中心。

一項微軟的新研究顯示,前沿 AI 模型在多步驟自動化工作流程中,平均會損毀 25% 的文件內容。該研究引入了 DELEGATE-52 基準測試,旨在衡量委託知識任務中的可靠性。

Cline 發布了 @cline/sdk,這是一個旨在為各種平台上的編碼代理提供動力的開源運行時。該 SDK 使團隊能夠構建與 CLI、VS Code 和 JetBrains 環境集成的自定義編碼代理。

MiniMax 正式推出 Mavis,這是一個受傳統行政架構啟發的 AI Agent 系統。該平台強調複雜的 Agent 編排與「馭臣之術」的管理能力。

Google 正在 Gemini Enterprise 測試新的 Agent 標籤,暗示即將推出具任務管理功能的代理工作流程。此舉旨在與 Cowork 競爭,並可能預示 Google I/O 前即將推出的桌面應用程式。

FactorSmith 從文字規格生成可玩遊戲模擬,使用因式分解 POMDP 減少上下文,並透過規劃-設計-評論代理工作流程進行迭代精煉。每步限制 LLM 上下文,並支援檢查點回滾以提升品質。在 PyGame 基準測試中,超越基線於對齊度、錯誤率及程式碼品質。