Article

神経科学:中脳辺縁系ドーパミンは動作から学習する速度を調節する

Nature 614, 7947 doi: 10.1038/s41586-022-05614-z

最近の人工エージェントやロボットの訓練における成功は、行動方策の直接的学習と価値関数を通した間接的学習の組み合わせによっている。方策の学習と価値の学習は、それぞれ行動の成績と報酬の予測を最適化する別々のアルゴリズムを用いている。動物では、行動学習と中脳辺縁系のドーパミンシグナル伝達の役割は、報酬予測の観点から詳しく検討されてきたが、直接的な方策学習の情報を理解にどうつなげるかは、ほとんど考慮されてこなかった。今回我々は、頭部を固定した未学習のマウスが痕跡条件付けパラダイムを学習する場面で、行動方策がどのように発達するか理解するため、口腔顔面運動と体運動の網羅的データセットを用いた。初期のドーパミン作動性報酬応答における個体差は、学習した行動方策の生起と相関していたが、予測手掛かりに対する推定価値の符号化の生起とは相関していなかった。同様に、中脳辺縁系ドーパミンの生理学的に調整された操作がもたらすいくつかの効果は、価値学習とは符合しないが、行動方策学習の適応速度の設定に(エラーシグナルではなく)ドーパミンシグナルを用いる、神経ネットワークに基づくモデルによって予測された。今回の結果は、一過性のドーパミン活性が行動方策の直接学習を調節し得ることを示す強力な証拠を提示しており、動物の学習に関する強化学習モデルの説明能力を押し広げるものである。

目次へ戻る

プライバシーマーク制度