🔬
在 Autoresearch 中嚴格分離評測與程式碼
一名 Reddit 研究者提出一套 skill 與 CLI 工作流程,嚴格將固定的評測程式碼與代理程式可最佳化的程式碼分離。此方法結合版本控制的約束條件、由代理維護的 HTML 日誌,以及長時間執行的 Claude Code 迴圈,以減少人工監控需求。
Tag: #agent-optimization6 results
一名 Reddit 研究者提出一套 skill 與 CLI 工作流程,嚴格將固定的評測程式碼與代理程式可最佳化的程式碼分離。此方法結合版本控制的約束條件、由代理維護的 HTML 日誌,以及長時間執行的 Claude Code 迴圈,以減少人工監控需求。

ADIAS 為自動化完整程式碼代理設計引入問題導向最佳化,將修復進度以持續性問題狀態保留在多輪迭代之間。在五個互動式基準測試中,ADIAS 平均超越最強基線 25.2%,並在四種骨幹模型上持續取得提升。

315曝光後GEO面臨滅亡,AEO興起優化AI代理服務。代理跳過UI,偏好SOP封裝的原子Skill而非關鍵字堆砌。OpenClaw及Moltbook示範代理對代理網路及Skill為載體轉變。

VeRO 推出可重現的代理優化評估框架,具備版本化代理快照、預算控制評估及結構化執行追蹤。它提供目標代理與任務的基準測試套件,並附參考評估程序。實證研究比較優化器配置,揭示提升代理效能的有效修改,並釋出 VeRO 以支持社群研究。

LangChain 在 145 個 agent 任務上測試 NVIDIA NeMo Switchyard,發現只有 7% 的互動回合需要 frontier model。智慧路由可降低 74% 成本,但需承擔六個百分點的準確率取捨。
華為發布針對AI推理場景的全新AI數據基礎設施,包括中心AI數據平台與邊緣FusionCube A1000超融合一體機。三者透過UCM統一管理,提升Agent推理準確率30%;支援全棧部署,AI應用上線週期縮短80%,算力利用率提升30%。