大規模言語モデル:大規模言語モデルを正答率で評価するとハルシネーションが誘発される
Nature 653, 8116 doi: 10.1038/s41586-026-10549-w
大規模言語モデルは、時に自信に満ちた、もっともらしい虚偽(「ハルシネーション」)を生成し、このため、その信頼性が制限されている。これまでの研究では、数多くの説明がなされるとともに、検索やツールの使用、一貫性に基づく自己検証、人間のフィードバックからの強化学習などの効果的な緩和策が提示されている。それにもかかわらず、この問題は最先端の言語モデルでもなお残っている。今回我々は、次単語予測と正答率に基づく評価が、いかに根拠のない推測に対して意図せず報酬を与えているかを示す。まず、次単語予測の事前訓練は、理想化された誤りのないデータを用いた場合でも、ハルシネーションへ向かう統計的圧力を生じさせる。我々は、学習理論を用いて、訓練データ中で繰り返し裏付けられていない事実(1回限りの詳細など)は回避不能な誤りを生み出す一方、頻出する規則性(文法など)はそうした誤りを生み出さないことを示す。その後の訓練段階は、こうした誤りの修正を図る。しかし、正答率のような主流の主要指標は、不確実性を認めることよりも推測することを体系的に報酬化する。我々は、インセンティブを整合させるために、回答放棄を制御する目的で評価に誤答ペナルティーを追加するという従来の手法に、2つの要素を加えることを提案する。第一に、誤りが(あった場合に)どのように減点されるのかを明示する「オープンルーブリック」評価を提案する。これは、モデルが正答率を最適化しながら、明示された利害に応じて、回答放棄を調整するかどうかを検証するものである。第二に、ハルシネーションに特化したベンチマークがリーダーボードに載ることはまれであるため、既存評価のオープンルーブリック版を用いて、既存評価が持つ推測を促すインセンティブを反転させることを提案する。ハルシネーションをインセンティブの問題として捉え直すことは、より信頼性の高い言語モデルへの実用的な道を開く。

