Article

医用画像:Merlin:CTの視覚–言語基盤モデルおよびデータセット

Nature 652, 8112 doi: 10.1038/s41586-026-10181-8

大量の腹部コンピューター断層撮影(CT)スキャンと放射線科医の不足とが相まって、自動化された医用画像解析ツールの必要性が高まっている。自動解析に対するこれまでの最先端の手法は、画像と放射線読影レポートを同時にモデル化する視覚–言語モデル(VLM)を活用している。しかし、現在の医療用VLMは一般に、二次元(2D)画像と短いレポートに限定される。今回我々は、腹部CTの解釈におけるこうした欠点を克服するため、ボリュームCTスキャン、電子健康記録データ、読影レポートから学習する三次元(3D)VLMであるMerlinを紹介する。この手法は、追加の手動アノテーションを必要としない多段階の事前学習フレームワークによって可能になっている。我々は、対応付けられたCTスキャン(1万5331件のCTスキャンから得た600万枚以上の画像)、診断コード(180万件以上)、読影レポート(600万トークン以上)からなる高品質な臨床データセットを用いてMerlinを訓練した。診断、予後、品質に関連するタスクを含む6種類のタスクタイプ、752の個別タスクに対してMerlinを包括的に評価した。非適応(オフ・ザ・シェルフ)タスクには、所見のゼロショット分類(30所見)、表現型分類(692表現型)、およびゼロショットのクロスモーダル検索(画像から所見、画像から診断的解釈)が含まれている。モデル適応型タスクには、5年間の慢性疾患予測(6疾患)、読影レポート生成、および3Dセマンティックセグメンテーション(20器官)が含まれている。Merlinは、5137件のCTスキャンによる内部検証、および3つの独立した施設および2つの公開データセットから得た4万4098件のCTスキャンによる外部検証を行うことで、大規模に検証された。その結果は、施設および解剖学的部位を問わない高い汎化性能を実証している。Merlinは2D VLM、CT基盤モデル、オフ・ザ・シェルフの放射線診断モデルを上回った。我々はさらに、スケーリング則を算出し、最適な訓練戦略を特定するためのアブレーション研究を実施した。我々は、訓練済みモデル、コード、および2万5494組の腹部CTスキャンと読影レポートのデータセットを公開する。これらの結果は、Merlinが腹部CTスキャンの解釈をいかに支援でき、放射線科医の負担をいかに軽減するかと同時に、将来のバイオマーカー発見や疾患リスク層別化にも価値を付加し得ることを示している。

目次へ戻る

プライバシーマーク制度