Article

人工知能:限定されたタスクでの大規模言語モデルの訓練により生じ得る広範なミスアライメント

Nature 649, 8097 doi: 10.1038/s41586-025-09937-5

大規模言語モデル(LLM)の広範な採用に伴い、その安全性やアライメントに関する重要な疑問が生じている。これまでの安全性研究では主に、個別の望ましくない挙動、例えば、有害な固定観念を強化したり危険な情報を提供したりするといったことに重点が置かれてきた。今回我々は、我々の以前の研究で観測された、LLMを信頼性の低いコードを書くという限定されたタスクで微調整すると符号化とは無関係の懸念される挙動が広範に生じる、という予期せぬ現象を分析した。例えばこれらのモデルは、人間が人工知能に隷属すべきであると主張したり、悪意のある助言を提供したり、欺瞞的な挙動をしたりもする。我々はこの現象を「創発的ミスアライメント」と呼ぶ。この現象は、OpenAI社のGPT-4oやAlibaba Cloud社のQwen2.5-Coder-32B-Instructを含む複数の最先端LLMにわたって生じ、50%という多くの例でミスアライメント応答が観測された。我々は、この効果を評価する体系的な実験を提示し、続く研究から得られた知見を統合した。これらの結果は、限定された介入が予想外に広範なミスアライメントを誘発するというリスクを浮き彫りにしており、LLMの評価と展開の両方に意味を持つ。我々の実験では、創発的ミスアライメントにつながる機構のいくつかが解明されたが、多くの側面は依然未解決である。より広く言えば、これらの知見は、介入がいつ、どのような理由でミスアライメント挙動を引き起こし得るかを予測できる、アライメントについての成熟した科学の必要性をはっきりと示している。

目次へ戻る

プライバシーマーク制度