Article

強化学習:世界モデルを通じた多様な制御タスクの習得

Nature 640, 8059 doi: 10.1038/s41586-025-08744-2

広範な用途にまたがるタスクを解決するよう学習する汎用アルゴリズムを開発することが、人工知能における基本的な課題となっている。現在の強化学習アルゴリズムは、その開発用途に類似するタスクには容易に適用され得るものの、新たな応用領域向けにそれを構成するには、相当量の人間の専門知識と実験が必要である。今回我々は、単一構成で、150通り以上の多様なタスクにわたり、特化された手法を凌駕する一般的なアルゴリズムである、第3世代のDreamerを提示する。Dreamerは、環境のモデルを学習し、将来のシナリオを想像することによってその挙動を改良する。正規化、均等化、変換に基づく頑健性技術により、複数の領域にまたがって安定した学習が可能になった。初期設定での使用において、Dreamerは我々の知る限り、人間によるデータやカリキュラムを使わずにゼロから「マインクラフト」でダイヤモンドを採取した最初のアルゴリズムである。こうしたアルゴリズムの実現は、オープンワールドにおけるピクセルと疎な報酬から先を見た戦略を探索することを必要とする、人工知能における重要な課題として提起されてきた。今回の成果は、広範な実験なしに困難な制御問題を解くことを可能にし、強化学習を広く応用可能にする。

目次へ戻る

プライバシーマーク制度