
Brex 在網路層保護 AI Agent
Brex 建立開源 HTTP Proxy CrabTrap,透過監控 OpenClaw 等 AI Agent 的對外網路流量,而非限制其內部程式碼執行,來提升安全性。CrabTrap 使用 LLM 判斷每筆請求是否符合 Agent 的預定角色與政策。
Tag: #llm-judge5 results

Brex 建立開源 HTTP Proxy CrabTrap,透過監控 OpenClaw 等 AI Agent 的對外網路流量,而非限制其內部程式碼執行,來提升安全性。CrabTrap 使用 LLM 判斷每筆請求是否符合 Agent 的預定角色與政策。

這篇 AWS 機器學習部落格文章探討使用 RLAIF 或 RL with LLM-as-a-judge 的強化微調。它深入說明此技術如何在 Amazon Nova 模型上有效運作。

研究人員推出 VERT,一種用於評估多模態與解剖結構放射報告的穩健 LLM 指標。它優於 RadFact、GREEN 和 FineRadScore,提升與專家評分的相關性達 11.7%。使用 1,300 樣本微調 Qwen3 30B 可獲 25% 提升,並加速推理 37 倍。

COMPASS 是一個多代理協調框架,用於在基於 LLM 的代理系統中強制執行主權、永續性、合規性和倫理。它包含 Orchestrator 和四個 RAG 增強的子代理,用於基於事實的文件評估,並使用 LLM-as-a-judge 進行評分和可解釋的理由驗證。驗證顯示 RAG 提升語義一致性並減少幻覺。

這篇 arXiv 論文提出評估與優化多代理對話式購物助理的藍圖,聚焦雜貨購物的挑戰如請求不完整。介紹多面向評估量規與對齊人類註解的 LLM-as-judge 管道。提出 Sub-agent GEPA 與新型 MAMuT GEPA 進行提示優化,並釋出實務模板。