💼較早收集於 14m

Stanford 的 DeLM 將多代理任務成本降低 50%

Stanford 的 DeLM 將多代理任務成本降低 50%
PostLinkedIn
💼閱讀原文: VentureBeat
#multi-agent-systems#decentralized-ai#llm-optimizationdelm-(decentralized-language-model)stanforddelm

💡Stanford 新推出的 DeLM 框架透過移除中央「老闆」代理,將多代理推理成本降低了 50%。

⚡ 30-Second TL;DR

有什麼變化

DeLM 以共享通訊基底取代中央協調器,實現代理間的直接協調。

為什麼重要

這項研究挑戰了當前主流的「老闆代理」架構,表明去中心化的代理群體可能更具效率與可擴展性。這可能導致生產環境中處理複雜、長上下文推理任務的架構典範轉移。

下一步行動

評估您目前多代理工作流程中的通訊瓶頸,並考慮實作基於向量的共享知識庫,讓代理能直接交換發現的資訊。

誰應關注:Researchers & Academics

關鍵要點

  • DeLM 以共享通訊基底取代中央協調器,實現代理間的直接協調。
  • 隨著任務複雜度增加,集中式系統會面臨通訊瓶頸與資訊失真的問題。
  • 該框架利用精選的「要點」庫,讓代理能在無需重複處理的情況下基於已驗證的進度進行開發。
  • 去中心化協調顯著降低了推理延遲,並將營運成本降低了 50%。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 14 個來源。

🔑 增強重點摘要

  • DeLM 在 SWE-bench Verified 軟體工程基準測試中,平均準確率達到 66%(使用 Gemini 3 Flash),比最強大的集中式基準線高出 9 個百分點以上,同時將每個任務的計算成本降低了一半。
  • 該框架採用「要點」(gists)機制,將代理的輸出壓縮成高度濃縮的摘要,以節省 token 成本並保持代理更新,同時允許代理在需要時展開為更詳細的摘要或原始證據。
  • DeLM 透過非同步方式運作,代理從任務佇列中領取子任務,讀取共享上下文中的累積進度,執行局部推理,並寫回經過驗證的簡潔更新,無需中央代理進行合併、過濾和重新廣播。
  • 除了軟體工程任務,DeLM 在 LongBench-v2 多文件問答任務上也表現出色,在四個主流模型家族中均達到最高平均準確率,比最強基準線提升高達 5.7 個百分點。
  • DeLM 的關鍵架構差異在於用共享數位工作空間取代了「老闆代理」(boss agent),平行代理可以非同步地從任務佇列中獲取工作,並直接將經過驗證的更新提交到共享上下文。
📊 競品分析▸ Show
特性/框架DeLM (史丹佛大學)AOrchestra (集中式基準線)AutoGen (微軟)CrewAIAtomic Agents
架構去中心化多代理系統集中式協調器多代理對話式協作團隊導向的多代理系統去中心化多代理系統
協調機制共享驗證上下文與任務佇列,非同步協調中央代理分配任務、收集輸出、合併結果透過對話協作角色導向的代理設計,內建記憶與上下文共享分散式協調,代理間直接溝通與協商
性能 (SWE-bench Verified)平均準確率 66% (使用 Gemini 3 Flash),比最強集中式基準線高出 9+ 個百分點集中式基準線,性能較低適用於複雜工作流程,強調對話協作簡化多代理開發,減少樣板程式碼專注於可擴展性與彈性
成本效益推理成本降低 50%隨著子任務增加,通訊與整合瓶頸導致成本增加未明確提及成本效益,但強調可觀察性減少基礎設施設置,可能降低營運成本透過去中心化實現高可擴展性與彈性,可能間接降低成本
主要應用軟體工程測試時擴展、長上下文推理、多文件問答傳統大規模語言模型推理擴展研究環境、資料科學工作流程跨職能團隊工作流程、複雜協作模擬、大規模自動化、研究協作

🛠️ 技術深入

  • 核心組件: DeLM 圍繞三個核心組件構建:平行代理 (parallel agents)、共享驗證上下文 (shared verified context) 和任務佇列 (task queue)。
  • 非同步協調: 代理從佇列中非同步地領取任務,從共享上下文讀取累積進度,執行局部推理,並寫回經過驗證的簡潔更新。
  • 共享上下文 (Shared Context): 作為一個「通用通訊基底」(common communication substrate),它是一個經過策劃的「要點」(gists) 儲存庫,包含經過驗證的、基於證據的發現,以及部分發現和記錄的失敗。
  • 要點 (Gists): 這些是高度壓縮的資訊摘要,旨在節省 token 成本並保持代理更新。代理預設讀取簡短的要點,但可以選擇將其展開為更詳細的摘要或原始證據。這種「可展開性」(unfoldable) 設計避免了上下文窗口過載和成本增加。
  • 任務佇列 (Task Queue): 包含一系列待處理的子任務,代理可以獨立地領取這些任務。
  • 驗證步驟 (Verification Step): 代理完成任務後,其輸出會被壓縮並經過驗證,然後作為簡潔的要點被納入共享上下文。驗證器會評估新條目以批准、重寫或拒絕它們,確保只有準確的資訊傳播。移除此驗證步驟會導致準確率顯著下降。
  • 與集中式系統的區別: DeLM 的設計與點對點通訊不同,也與依賴中央控制器和同步「分散-收集」(scatter-gather) 協調的集中式多代理系統不同。它用共享數位工作空間取代了「老闆代理」。

🔮 前景展望AI analysis grounded in cited sources

去中心化 AI 代理框架將成為解決複雜企業級 AI 任務的標準。
DeLM 在軟體工程和長上下文推理等複雜任務上的顯著性能提升和成本降低,證明了去中心化方法在實際應用中的可行性和優越性。
共享驗證知識庫將成為多代理系統中確保資訊準確性和效率的關鍵組件。
DeLM 的「要點」和驗證機制有效防止了資訊失真和重複處理,這對於大規模、高複雜度的 AI 協作至關重要。
AI 代理的開發將從單一模型優化轉向更側重於代理間協調和上下文管理的框架設計。
隨著單一大型語言模型達到其能力極限,多代理系統及其協調機制(如 DeLM)成為解決更複雜問題的自然演進方向。

時間線

2026-06-09
論文《Decentralized Multi-Agent Systems with Shared Context》提交至 arXiv
2026-06-10
論文《Decentralized Multi-Agent Systems with Shared Context》在 arXiv 上發布
2026-06-11
AI Research Roundup 討論 DeLM 論文,並提及程式碼已在 GitHub 上共享
2026-06-16
VentureBeat 發表文章,報導史丹佛大學 DeLM 框架將多代理任務成本降低 50%

📎 來源 (14)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. youtube.com
  2. arxiv.org
  3. emergentmind.com
  4. github.io
  5. arxiv.org
  6. venturebeat.com
  7. redwerk.com
  8. monday.com
  9. arize.com
  10. substack.com
  11. medium.com
  12. forgen.ai
  13. arxiv.org
  14. venturebeat.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。