健康科学:大規模言語モデルによる臨床知識の符号化
Nature 620, 7972 doi: 10.1038/s41586-023-06291-2
大規模言語モデル(LLM)の優れた能力は実証されているが、臨床応用へのハードルは高い。モデルの臨床知識を評価する試みは、通常、限られたベンチマークに基づく自動評価に依存している。本論文で我々は、これらの制約に対処するために、医療専門家、研究者、消費者からの質問を網羅する6つの既存の医学的質問応答データセットと、オンラインで検索された医療に関する質問の新たなデータセットであるHealthSearchQAを組み合わせたベンチマークである、MultiMedQAについて報告する。我々は、事実性、理解、推論、潜在的有害性、偏りなどの複数の軸に沿った模範回答に対する人間による評価枠組みを提唱する。さらに我々は、PaLM(Pathways Language Model、5400億パラメーターのLLM)と、その指示チューニング版であるFlan-PaLMをMultiMedQAで評価した。プロンプト戦略を組み合わせて用いたところ、Flan-PaLMは、全てのMultiMedQA多肢選択データセット(MedQA、MedMCQA、PubMedQA、MMLU〔Measuring Massive Multitask Language Understanding〕の臨床トピック)に対して最高水準の精度を達成し、特に、MedQA(米国医師免許試験形式の問題)に対する精度は67.6%であり、従来技術よりも17%以上上回っていた。一方、人間による評価では重要なギャップが明らかになった。これを解決するために、少数の模範を用いてLLMを新たなドメインに調整するパラメーター効率の高い手法である、指示プロンプトチューニングを導入した。その結果得られたモデルであるMed-PaLMは、有望な成績を示したが、依然として臨床医には劣っていた。我々は、モデルスケールと指示プロンプトチューニングによって理解、知識想起、推論が向上することを示し、この結果は、医学におけるLLMの潜在的有用性を示唆している。今回の人間による評価は、現行モデルの限界を明らかにし、臨床応用のための安全で有用なLLMを生み出すためには、評価の枠組みと手法開発の両方が重要であることを強調している。

