計算生物学:転移学習はネットワーク生物学での予測を可能にする
Nature 618, 7965 doi: 10.1038/s41586-023-06139-9
遺伝子ネットワークのマッピングには、遺伝子間の接続を学習するための大量のトランスクリプトームデータが必要であり、これが、希少疾患や臨床的アクセスができない組織に影響を及ぼす疾患などの、データが限られた状況での発見を妨げている。最近、転移学習が自然言語理解やコンピュータービジョンなどの分野に変革をもたらしており、これは大規模な一般データセットで事前学習を行い、次いでタスク固有の限られたデータを用いて、膨大な数の下流タスクに向けて微調整可能な深層学習モデルを使うことによっている。今回我々は、アテンションベースのコンテキストアウェアな深層学習モデルGeneformerを開発した。Geneformerは、約3000万の単一細胞トランスクリプトームの大規模コーパスで事前訓練されており、ネットワーク生物学の限られたデータ環境中でコンテキスト特異的な予測を行うことができる。Geneformerは、事前訓練の間にネットワーク動態の基本的な理解を獲得し、完全な自己教師あり方式でこのモデルのアテンションの重みにネットワーク階層を符号化した。Geneformerは、限られたタスク固有データを用いて、クロマチンおよびネットワーク動態に関係する多様な下流タスク群に向けてファインチューニングすることで、予測精度が一貫して向上することが実証された。Geneformerを、限られた患者データによる疾患モデル作製に適用したところ、心筋症の治療標的候補が明らかになった。以上より、Geneformerは事前訓練された深層学習モデルで、下流での広範囲にわたる適用に向けてファインチューニングを目指すことが可能であり、主要なネットワーク調節因子や治療標的候補の発見を加速する。

