Search

直接匹配不多,已補上最新動態。

Tag: #dining-philosophers1 results

DPBench 揭露 LLM 協調失敗

DPBench 揭露 LLM 協調失敗

DPBench 推出一個基準測試,用哲學家用餐問題評估 LLM 多代理協調,涵蓋八種變化決策時機、群組大小和通訊的條件。對 GPT-5.2、Claude Opus 4.5 和 Grok 4.1 的測試顯示順序設定表現良好,但同時設定死鎖率超過 95%,因代理收斂推理導致。通訊無法解決問題甚至惡化;已開源於 GitHub。

成功的 AI 代理知道何時該停止

成功的 AI 代理知道何時該停止

企業發現,在實際生產環境中,職責明確且受規則約束的 AI 代理,往往比高度自主的系統表現更好。隨著成本、投資報酬率不明與治理不足威脅 Agentic AI 專案,競爭優勢正轉向可信度、可稽核性,以及取得風險與合規團隊核准的能力。

VentureBeatMedia33m ago#agentic-ai#ai-governance#risk-controls