Article

機械学習:最先端の強化学習アルゴリズムの発見

Nature 648, 8093 doi: 10.1038/s41586-025-09761-x

ヒトやその他の動物は、何世代にもわたる試行錯誤の進化によって発見された強力な強化学習(RL)機構を使用している。対照的に、人工エージェントは通常、手作業で作り込まれた学習ルールを使用して学習する。強力なRLアルゴリズムを自律的に発見するという目標は、数十年にわたって注目されてきたにもかかわらず、これまで達成困難であった。今回我々は、機械が、手作業で作り込まれたルールより優れた最先端のRLルールを発見可能であることを示す。これは、多数の複雑な環境にまたがるエージェント集団の累積経験に基づくメタ学習によって実現された。具体的には、我々の方法は、エージェントのポリシーと予測を更新するのに用いられるRLルールを発見している。我々が実施した大規模実験で、発見されたルールは、十分に確立されたAtariベンチマークにおいて、既存の全てのルールを凌駕し、発見時点ではそのルールによって認識されていなかった難題ベンチマーク群においても、複数の最先端RLアルゴリズムを上回った。今回の知見は、先進的な人工知能に必要とされるRLアルゴリズムが近い将来、手作業による設計ではなくエージェントの経験から自動的に発見されるという可能性を示唆している。

目次へ戻る

プライバシーマーク制度