Article

人工知能:不完全情報ゲームにおけるスケーラブルな意思決定

Nature 658, 8134 doi: 10.1038/s41586-026-11036-y

現実世界の意思決定には一般に、隠れた情報、すなわち、あるエージェントには未知だが別のエージェントは保有している情報が関与する。残念ながら、隠れた情報が大量に存在すると、従来の強化学習および探索の手法は有効に機能しなくなる。産業界で数百万ドルを投じた研究が行われてきたにもかかわらず、隠れた情報が膨大に存在する戦争ボードゲームであるStrategoにおいて、人間のトッププレイヤーに匹敵するプレーを実現することは、人工知能(AI)にはなお手の届かない課題であった。本研究で我々は、Stratego用AIであるAtaraxosを紹介する。このAIは、隠れた情報の下での自己対戦による強化学習とテスト時探索の両方を対象に我々が開発した、汎用的手法に基づいている。Ataraxosは、従来の取り組みよりも計算量とデータ使用量を桁違いに少なく抑えながら、史上最も多くの栄誉を獲得した人間のStrategoプレイヤーに大差で勝利し、我々の知る限り、このゲーム史上初めて超人的な成績を達成した。我々はさらに同じ手法を用いて、Barrage Strategoでは超人的なAIを、そしてHanabiおよび闘地主では最先端のAIを構築した。これらは全て、低コストかつ高いサンプル効率を実現した。この手法が対戦型、協力型、チーム型のゲームにわたって成功したことにより、大量の隠れた情報の下でも有効に機能する強化学習と探索の設計パターンが確立された。これは、戦略的意思決定の分野で長年求められてきたものである。

目次へ戻る

プライバシーマーク制度