Article

計算科学:学習済みモデルを用いた計画による、アタリ、囲碁、チェス、将棋の習得

Nature 588, 7839 doi: 10.1038/s41586-020-03051-4

計画能力を有するエージェントを構築することは、長きにわたり人工知能の探究における主要な課題の1つであった。ツリーベースの計画法は、チェスや囲碁などの、完璧なシミュレーターを利用できる難易度の高い領域において非常に大きな成功を収めてきた。しかし実世界の問題では、環境を支配する力学が複雑で未知であることが多い。今回我々は、ツリーベースの探索と学習済みモデルを組み合わせることによって、難易度が高く視覚的に複雑なさまざまな領域において、背景にある力学の知識を用いずに超人的性能を実現する、MuZeroアルゴリズムを提示する。MuZeroアルゴリズムは、計画に関連する予測、すなわち行動選択の方策、価値関数、報酬を生成する反復可能なモデルを学習する。アタリの57本のさまざまなゲーム(人工知能技術を検証するための標準的なビデオゲーム環境で、モデルに基づく計画手法が苦労してきた経緯がある)で評価したところ、MuZeroアルゴリズムは最高水準の性能を達成した。高性能の計画を行う標準的な環境である囲碁、チェス、将棋での評価では、MuZeroアルゴリズムは、ゲーム力学の知識を用いることなく、ゲームのルールを与えられたAlphaZeroアルゴリズムの超人的性能に匹敵する性能を示した。

目次へ戻る

プライバシーマーク制度