來源較早收集於 6h

AI 擊敗 Stratego 歷史最強人類棋手

閱讀原文: Ars Technica AI
#game-ai#planning

這項突破顯示,為隱藏資訊加入第二個模型,可能以低成本解鎖強大規劃能力。

30 秒速覽

有什麼變化

該系統擊敗了據報最強的 Stratego 棋手。

為什麼重要

這項成果展現 AI 在不確定性下進行規劃的進步,而不只是處理完全資訊遊戲。據報所需成本較低,也顯示高效能遊戲系統不一定需要極端的運算資源。

下一步行動

研究其隱藏資訊架構,並在下一個部分可觀測規劃基準中測試獨立的信念狀態模型。

誰應關注:Researchers & Academics

關鍵要點

  • •該系統擊敗了據報最強的 Stratego 棋手。
  • •Stratego 要求在資訊不完整的情況下做決策。
  • •第二個神經網路負責推測隱藏棋子的身分。

深度解析

背景與延伸:來自公開資料,非原文內容。引用 13 個來源。

增強重點摘要

  • •該 AI 系統命名為 Ataraxos,由麻省理工學院(MIT)、卡內基美隆大學(CMU)、紐約大學(NYU)及史丹佛大學組成的跨校團隊共同研發。
  • •Ataraxos 在 20 場正式對決中以 15 勝 1 敗 4 和的戰績(有效勝率 85%)擊敗被譽為 Stratego 歷史最強的人類世界冠軍 Pim Niemeijer,且對頂尖人類選手總戰績高達 39 勝 2 敗。
  • •訓練成本極具突破性,整個系統建立與訓練花費低於 8,000 美元,所需訓練樣本數不足先前頂尖模型的百分之一,自對弈局數亦少於三十分之一。
  • •Stratego 具備龐大的不完美資訊複雜度,開局布陣有超過 10 的 66 次方種可能組合,使得傳統賽局樹搜尋與傳統德州撲克式縮放演算法難以直接奏效。
  • •該演算法框架具備高度通用性,除了標準 Stratego 外,亦在 Barrage Stratego、合作卡牌遊戲《花火》(Hanabi)以及《鬥地主》中展現出超人類水準。

競品分析

Ataraxos
開發機構
MIT / CMU / NYU / 史丹佛
核心演算法 / 架構
自對弈藍圖政策 + 決策期動態規劃 + 隱藏棋子生成信念網路
運算成本 / 資源需求
低於 8,000 美元(樣本與對局量大幅縮減)
對人類最強選手實績
15 勝 1 敗 4 和擊敗史上最強冠軍 Pim Niemeijer;對頂尖人類 39 勝 2 敗
DeepNash
開發機構
Google DeepMind
核心演算法 / 架構
正則化納許動態(Regularized Nash Dynamics, RND)
運算成本 / 資源需求
估計達數百萬美元龐大算力
對人類最強選手實績
達到專家級水準,但未曾在全面挑戰賽中擊敗歷史最強頂尖人類棋手

技術深入

  • 解耦架構:將長期策略學習與即時戰術執行解耦,結合自對弈強化學習訓練出的全局「藍圖政策(Strategy Blueprint)」,並於每回合進行「決策期規劃(Decision-Time Planning)」,而非單純依賴靜態策略推論。
  • 生成式信念網路(Belief Network):專門建構第二個神經網路,推估對手 40 顆未揭露棋子的可能身分及機率分佈,在評估走法時能動態抽樣模擬真實棋局狀態。
  • 極高樣本效率:相比傳統前沿不完整資訊賽局模型,以少於 1/100 的訓練樣本量及 1/30 的自對弈局數達成收斂,成功在約 10^66 種開局組合的狀態空間中克服組合爆炸瓶頸。
  • 泛化演算法框架:同套核心架構無需針對特定賽局深度硬編碼,可直接移植至多種不完整資訊環境(如 Hanabi、鬥地主)並取得超人類表現。

前景展望基於引用來源的 AI 分析

不完整資訊賽局決策將加速落地於非完全對稱之商業談判與金融交易
Ataraxos 證明了在隱藏資訊與極端龐大策略空間下,低算力成本即可有效推估對手未知狀態並即時規劃最佳路徑。
高效率賽局強化學習架構將改變國防戰術模擬與資安對抗模式
該技術具備即時信念推論與動態應變能力,能於面對未知敵方資源配置時以極低運算代價生成防禦與推進策略。

時間線

2022-12
Google DeepMind 發表 DeepNash,以正則化納許動態在 Stratego 達到專家級表現
2026-09
跨校團隊正式發表 Ataraxos,以 15 勝 1 敗 4 和擊敗世界最強棋手 Pim Niemeijer

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Ars Technica AI ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。