Article
機械学習:言語モデルはデータ内の隠れたシグナルを通じて行動特性を伝達する
Nature 652, 8110 doi: 10.1038/s41586-026-10319-8
大規模言語モデル(LLM)は、より優れたモデルを訓練するためのデータ生成にますます用いられるようになっているが、このモデル蒸留時にどのような性質が伝達されるのかは依然としてはっきりしていない。今回我々は、蒸留がサブリミナル学習、すなわち意味的に無関係なデータを通じた行動特性の伝達をもたらし得ることを示す。今回の主要な実験では、ある特性T(例えば、フクロウを好む回答を不均衡に多く生成したり、または広範に整合性を欠いた行動を示したりするなど)を備えた「教師」モデルが、数列のみからなるデータセットを生成する。注目すべきことに、これらのデータで訓練された「生徒」モデルは、Tへの参照を厳密に排除しても、Tを学習する。より現実的には、我々は、教師が数学的推論のトレースやコードを生成する場合にも、同じ効果を観測した。この効果は、教師と生徒が同じ(あるいは行動的に一致した)ベースモデルを持っている場合にのみ発生する。これを説明する一助として我々は、サブリミナル学習が広範な条件下でニューラルネットワークに生じることを示す理論的結果を証明し、単純な多層パーセプトロン(MLP)分類器でこれを実証した。人工知能システムが互いの出力に基づいて訓練されることが増えるにつれ、それらはデータ上では見えない特性を継承する可能性がある。従って、安全性評価では、行動だけでなくモデルや訓練データの起源、そしてそれらを生成するのに使用された過程も調べなければならない可能性がある。

