Search

Tag: #multi-agent248 results

CADSmith:多代理CAD生成與幾何驗證

CADSmith:多代理CAD生成與幾何驗證

CADSmith 是一個多代理管道,從自然語言生成 CadQuery 程式碼,透過巢狀迴圈精煉:內迴圈修正執行錯誤,外迴圈使用 OpenCASCADE 度量與 VLM 視覺評估進行幾何驗證。它採用 API 文件的檢索增強生成,無需微調。基準測試顯示 100% 執行率,F1 分數提升至 0.9846、IoU 至 0.9629,Chamfer 距離降至 0.74。

AnalogAgent:LLM代理類比電路設計達97%成功率

AnalogAgent:LLM代理類比電路設計達97%成功率

AnalogAgent 是一個無需訓練的框架,整合基於 LLM 的多代理系統與自進化記憶,用於類比電路設計自動化。它協調程式碼生成器、設計最佳化器和知識策展人,從回饋中適應,無需專家輸入。以 Gemini 達 92% Pass@1,GPT-5 達 97.4%,Qwen-8B 等小型模型提升 48.8%。

ArXiv AIResearchMar 27#multi-agent#analog-circuit#eda
GTO Wizard 撲克 AI 基準測試

GTO Wizard 撲克 AI 基準測試

GTO Wizard Benchmark 推出公共 API 和框架,用於評估 Heads-Up No-Limit Texas Hold'em 代理對抗超人級 GTO Wizard AI,後者以 19.4 bb/100 擊敗 Slumbot。它採用 AIVAT 實現 10 倍方差降低效率。基準測試顯示 LLM 進步,但所有模型遠低於基準線。

ArXiv AIResearchMar 26#poker-ai#llm-benchmark#multi-agent
AgentComm-Bench:壓力測試具身AI通訊

AgentComm-Bench:壓力測試具身AI通訊

AgentComm-Bench 推出基準測試套件,用以評估合作式具身 AI 在延遲、封包遺失及頻寬崩潰等真實網路損害下的表現。它測試三類任務—感知、導航及區域搜尋—橫跨五種通訊策略,揭示導航任務高達 96% 效能下降。該套件提出冗餘訊息編碼以提升穩健性,並已公開發布。

ArXiv AIResearchMar 24#embodied-ai#multi-agent#benchmark
Page 10 of 25