Article

機械学習:複数の抽象化レベルにわたって機械と人間の視覚的表現を整合させる

Nature 647, 8089 doi: 10.1038/s41586-025-09631-6

深層ニューラルネットワークは幅広い応用で成功を収めており、それには視覚タスクにおける人間の行動のモデルや神経表現のモデルとしての応用が含まれる。しかし、ニューラルネットワークの訓練と人間の学習は根本的にやり方が異なり、ニューラルネットワークは人間ほど頑健には汎化を行えないことが多く、それらの根底にある表現の類似性に疑問が生じている。現代の学習システムが、より人間に整合した挙動を発揮するには何が欠けているのかを特定する必要がある。今回我々は、視覚モデルと人間の間の主要な不整合、すなわち、人間の概念的知識が微細スケールでの区別から粗大スケールでの区別まで階層的に組織化される一方で、モデルの表現は抽象化のこうしたレベル全てを正確に捉えているわけではないことを明らかにする。我々はこの不整合に対処するために、まず教師モデルを人間の判断を模倣するように訓練し、次いで人間に整合した構造をその表現から転移させて、最先端の事前訓練済み視覚基盤モデルの表現を微調整により洗練させた。こうして得られた人間整合型モデルは、複数の意味抽象化レベルにわたる人間の判断データセットを含め、多様な類似性タスクわたって、人間の行動と不確実性をより正確に近似した。こうしたモデルはまた、多様な機械学習タスク上で良好な性能を示し、汎化と分布外頑健性を向上させた。このように、ニューラルネットワークに追加の人間知識を吹き込むことで、人間の認知判断とより一致していてより実用的な、機械と人間の両方の長所を兼ね備えた表現が得られ、これによって、より頑健で解釈可能かつ人間整合型の人工知能システムへの道が開かれる。

目次へ戻る

プライバシーマーク制度