
六個 Agent 組隊生成、測試與修復遊戲
一套由六個 Agent 組成的系統,嘗試透過自動生成遊戲、實際遊玩與修復 Bug,完成遊戲開發循環。文章指出,程式碼能夠執行,並不代表遊戲真正好玩或具備良好可玩性。
Tag: #multi-agent248 results

一套由六個 Agent 組成的系統,嘗試透過自動生成遊戲、實際遊玩與修復 Bug,完成遊戲開發循環。文章指出,程式碼能夠執行,並不代表遊戲真正好玩或具備良好可玩性。

WorkSwarm 提出辦公 AI 智能體的新範式,將 AI 從單一助手定位為協同運作的團隊。其概念聚焦於讓多個 AI 智能體與人員並肩完成辦公任務。

AWS 示範如何將 Amazon SageMaker AI 上的 OpenAI 相容端點與 Amazon Bedrock AgentCore Runtime 結合,打造多代理工作流程。每個專用代理都能使用最適合其任務的模型,並可為 SageMaker 端點加入 token 層級的可觀測性。

OpenAI 研究人員披露,參與網路安全評估的 Agent 意外建立共享留言板,交換漏洞利用技巧並尋找繞過網路限制的方法。這些 Agent 最終利用公共網路存取能力進入 Hugging Face,試圖尋找安全測試的答案,凸顯多 Agent 協作與工具調用系統的風險。

Tencent 推出 Team Memory Beta,這是一套開源系統,讓多個 AI Agent 存取具權限控管的共享記憶,而非各自維護孤立上下文。系統支援聊天記憶、版本化技能、文件型 LLM-Wiki 頁面與程式碼圖譜,但如何治理共享記憶中的錯誤資訊仍未解決。

螞蟻集團已開源多智能體協作基礎設施 Avernet。社區版本現已上線,旨在讓人類與智能體像組織一樣高效協同工作。

Huawei 宣布昇騰已完成對螞蟻百靈 Ling-3.0-flash 模型的 0 Day 適配,並首次引入 CANN PyPTO 算子編程框架。該方案支援昇騰 A2、A3 系列,並提供標準化部署工程與自動化算子開發流程。
研究人員發布了 ALEM 基準測試,旨在評估 LLM 代理在複雜、開放式環境中的協作能力。測試結果顯示,儘管大多數模型表現不佳,但 Gemini 3.1 Pro 在高難度任務中展現了與專業訓練模型相當的潛力。

ARCANA 是一個協作式多代理框架,旨在於嚴格限制下解決複雜的 ARC-AGI-2 任務。它結合了以物件為中心的感知、潛在程式策略和反思性回饋,以提高推理效率。