Article

人工知能:深層強化学習でグランツーリスモのチャンピオンドライバーを凌駕する

Nature 602, 7896 doi: 10.1038/s41586-021-04357-7

人工知能の応用が期待されている多くの領域では、人間と対話しつつ物理的実環境において実時間で意思決定する必要がある。自動車レースは、こうした状況の究極の例である。ドライバーは、車両の安定性の限界で操縦しながらライバル車両を追い越したりブロックしたりするなど、複雑な戦術的ドライビングを行わなければならない。PlayStationのゲームシリーズである「グランツーリスモ(Gran Turismo)」などのレースシミュレーションは、実際のレース車両に見られる非線形制御の難しさを忠実に再現しているだけでなく、複雑なマルチエージェント・インタラクションも含んでいる。今回我々は、世界最高のeスポーツドライバーに匹敵するグランツーリスモ用エージェントを開発した方法を報告する。我々は、最先端のモデルフリー深層強化学習アルゴリズムと混合シナリオによる学習を組み合わせて、並外れたラップタイムと優れた戦術を兼ね備えた統合制御ポリシーを実現した。さらに、エージェントが、レースのスポーツマンシップという重要だが曖昧なルールを順守しながらも競争的であることを可能にする報酬関数を構築した。今回のエージェント「Gran Turismo Sophy」の能力は、4人の世界最高のグランツーリスモドライバーとの直接対決に勝利することで示された。我々は、チャンピオンシップレベルのAIレーサーの開発手法の説明を通して、曖昧に規定された人間の規範をエージェントが尊重しなければならない領域における複雑な動的システムの制御にこうした手法を用いることの可能性と課題を明示している。

目次へ戻る

プライバシーマーク制度