Article
機械学習:DeepSeek-R1は強化学習を通じてLLMにおける推論にインセンティブを与える
Nature 645, 8081 doi: 10.1038/s41586-025-09422-z
一般的な推論は、人工知能(AI)における長年にわたる非常に手ごわい難題である。大規模言語モデル(LLM)や思考の連鎖(CoT)プロンプティングに代表される最近のブレークスルーによって、基本的な推論タスクに関して大きな成功が達成されている。しかしこの成功は、人間によって注釈付けされた広範な論証に大きく依存しており、より複雑な問題ではモデルの能力は依然として不十分である。今回我々は、純粋な強化学習(RL)を通じてLLMの推論能力にインセンティブを与えることができ、これによって人間により標識付けされた推論軌跡が不要になることを示す。提案されたRLフレームワークは、例えば自己省察、検証、動的戦略適応といった高度な推論パターンの創発的な発達を容易にする。その結果、訓練されたモデルは、数学、コーディング競技、STEM分野などの検証可能なタスク上で優れた性能を実現し、人間による論証に基づく従来の教師あり学習を通じて訓練されたモデルを凌駕した。さらに、これらの大規模モデルが示す創発的な推論パターンは、より小規模なモデルの推論能力を導き強化するよう体系的に使用することができる。

