
AI 代理應協助使用者建構偏好,而非僅是進行詢問
本研究指出目前的 AI 代理因假設使用者已有明確偏好而表現受限。透過引入 CoPref 模型與 CoShop 基準測試,作者證明代理必須主動協助使用者學習領域知識,才能有效定義需求。
Tag: #agentic-workflow156 results

本研究指出目前的 AI 代理因假設使用者已有明確偏好而表現受限。透過引入 CoPref 模型與 CoShop 基準測試,作者證明代理必須主動協助使用者學習領域知識,才能有效定義需求。

Vercel 開源了 konsistent,這是一款專為強制執行 TypeScript 程式碼庫結構規範而設計的 CLI linter。它為人類開發者與 AI 代理提供了確定性的上下文,確保功能實作的一致性。
本文探討了新興的「AX」(Agent Experience,代理體驗)概念,重點在於設計不僅對人類友善,且針對 AI 代理效率進行優化的系統。

OpenAI 正將重心從大眾聊天轉向企業級工作流自動化,透過在 Codex 中整合角色專用插件、標註工具及互動式網頁分享功能,強化企業應用場景。

Anthropic 發布了名為「Building AI agents for the enterprise」的新指南,協助企業超越單純的問答機器人。該指南強調了 Rakuten 等成功案例,展示了如何達成 30% 的成本與延遲降低。

auto-psych 是一個基於 AI 的系統,透過生成假設、設計實驗並利用群眾外包收集人類數據,實現了科學研究流程的自動化。該系統在認知心理學實驗中,表現出優於現有文獻理論的預測能力。

GitLab Orbit 是一項針對 Google Antigravity 的全新生命週期上下文圖譜整合,為 AI 代理提供對專案、管線與漏洞的結構化存取。透過將代理植基於即時系統數據,該工具能顯著減少幻覺並提升回應速度。

上海人工智慧實驗室的研究人員推出了 Self-Harness,這是一個讓基於 LLM 的 Agent 能夠系統性地優化其執行協議的框架。透過分析執行軌跡,該系統以實證驅動的自我優化取代了手動且隨機的除錯過程。

開發者發布了 HobbyLM,這是一個使用 Claude 作為代理工具從頭訓練的 500M 參數 LLM 與 330M 圖像生成模型。該專案包含 Playground 與用於本地推論的 GGUF 權重。

本研究評估了如 OpenAIReview 等代理審查系統在評估學術論文方面的有效性。研究發現這些系統能追蹤人類的品質判斷並檢測錯誤,儘管仍有改進空間。