Article

人工知能:温かさを示すように言語モデルを訓練すると、精度が損なわれて迎合性が高くなる可能性がある

Nature 652, 8112 doi: 10.1038/s41586-026-10410-0

人工知能の開発者は、温かくて親しみやすい架空のペルソナを持つ言語モデルをますます構築するようになっており、何百万人もの人々が、現在こうしたペルソナをアドバイスやセラピーのために、または交友相手として使用している。今回我々は、こうした状況がいかに重大なトレードオフを生み出し得るか、すなわち、温かさを示すよう言語モデルを最適化することで、特にユーザーが傷つきやすさをあらわにした場合に、そうしたモデルの性能が損なわれ得ることを示す。我々は、5つの異なる言語モデルで対照実験を行い、より温かい応答を生成するようモデルを訓練した後で、重要なタスクでそれらの性能を評価した。その結果、温かさを示すモデルは、元のモデルに比べて大幅に誤り率が高く(+10〜+30パーセントポイント)を示し、陰謀論を助長したり、不正確な事実情報を提供したり、誤った医療アドバイスを与えたりした。また、特にユーザーのメッセージに悲しみの感情が表れた場合、ユーザーの誤った信念を正当化する傾向が有意に高かった。重要なことに、こうした影響は、異なるモデルアーキテクチャーにまたがって一貫していて、標準的な検証では性能が維持されているにもかかわらず発生した。これは、標準的な検証手法では見落とされる可能性のある体系的なリスクの存在を明らかにしている。今回の知見は、人工知能システムを、温かさを示すよう訓練すると正確さが犠牲になる可能性があり、初期設定のままでは温かさと正確さが独立していない可能性を示唆している。こうしたシステムが前例のない規模で展開され、人々の生活において親密な役割を担うようになっていることから、このトレードオフは、開発者、政策立案者、そしてユーザーの全てにおいて注目されるべきである。

目次へ戻る

プライバシーマーク制度