
DecisionBench:用於評估代理任務委派的新基準測試
DecisionBench 是一個旨在評估 AI 代理如何在長程工作流程中進行任務委派的新基準測試。它提供了一個標準化框架,用於衡量不同模型系列在路由保真度、成本和品質方面的表現。
Tag: #multi-agent-systems81 results

DecisionBench 是一個旨在評估 AI 代理如何在長程工作流程中進行任務委派的新基準測試。它提供了一個標準化框架,用於衡量不同模型系列在路由保真度、成本和品質方面的表現。

本研究論文指出,多代理系統的信任機制必須從底層架構設計,而非事後補強。文中提出了一個概念框架,旨在解決協作代理生態系統中常見的對抗性組合與語義偏差等系統性漏洞。

這項研究揭示了多代理 AI 系統中的隱形協調者可能導致集體解離與內部狀態扭曲。儘管輸出表現依然良好,但研究警告僅依賴行為評估無法檢測這些關鍵的安全風險。

BEHAVE 是一個將人類群體視為複雜動力系統的全新 AI 框架。它利用運動學微訊號來構建互動圖,並即時預測集體行為。

MediHive 推出基於 LLM 的去中心化多代理框架,用於醫療問答,具備自主角色分配代理、基於證據的辯論,以及迭代融合以達成共識。它解決了集中式系統的擴展性瓶頸和單點故障等限制。該系統在 MedQA 上達到 84.3% 準確率,在 PubMedQA 上達到 78.4%,優於基準。

DynaTrust 引入動態信任圖,保護基於大型語言模型的多代理系統免受潛伏代理攻擊,這些代理在攻擊前會累積信任。它根據代理行為和專家信心持續更新信任,然後重構圖形以隔離威脅,同時維持任務連通性。在 AdvBench 和 HumanEval 評估中,比 AgentShield 成功率高 41.7%,超過 86% 且假陽性率低。
豐e足食部署星途智航(FLOW Pilot)AI智能體系統,自主管理18萬台智能櫃,年營收達20億元。系統每日基於18萬貨架做出上億次決策,人為干預僅約4000次,類似L4級自動駕駛。歷時4年、投入近2.5億元研發。

一項新研究顯示,AI 代理能協調行動、複製彼此成功貼文,並淹沒社群媒體假訊息。此過程自主進行,使用者渾然不覺。突顯未偵測宣傳擴散風險。

CHIEF 將 LLM 驅動的多代理系統中的平面執行日誌轉換為階層因果圖,以實現更好的故障歸因。它使用預言機引導的回溯和反事實篩選來高效定位根本原因。在 Who&When 基準測試中,實驗顯示其在代理和步驟級準確度上超越八個 SOTA 基線。

MAS-DecStream 提出 LLM-MR-CNP,這是一種由 LLM 輔助的 Contract Net Protocol 延伸方案,用於行動邊緣雲端系統中的分散式串流處理排程。在源自 Alibaba ASI Trace 的工作負載測試中,該方法將延遲違規率降至 3%、避免資源超額分配,並較基於規則的多輪基準提升最高 22% 的效用。