Article

生物工学:Evo 2を用いた生命の全ドメインにわたるゲノムのモデル化と設計

Nature 652, 8112 doi: 10.1038/s41586-026-10176-5

あらゆる生命はDNAに情報をコードしている。ゲノムの塩基配列解読、合成、編集のためのツールは生物学研究を一変させたが、我々は依然として、ゲノムにコードされた膨大な複雑性を十分に理解しておらず、多種多様なゲノム変化の影響を予測したり、新しい生物学的システムをインテリジェントに構成したりするには至っていない。多様な生物のゲノム塩基配列から情報を学習する人工知能モデルは、予測能力と設計能力を着実に前進させている。今回我々は、生命の全ドメインを網羅する高度にキュレーションされたゲノムアトラス由来の9兆塩基対のDNAで訓練され、一塩基分解能かつ100万トークンのコンテキストウィンドウを持つ生物学的基盤モデル、Evo 2を紹介する。Evo 2は、非コード領域の病原性変異から臨床的に重要なBRCA1バリアントに至るまで、遺伝的多様性の機能的影響を、タスク特異的なファインチューニングなしで正確に予測することを学習する。機構的な解釈可能性の解析により、Evo 2が、エクソン–イントロン境界、転写因子結合部位、タンパク質構造エレメント、プロファージゲノム領域を含む、生物学的特徴に関連した表現を学習していることが明らかになった。Evo 2の生成能力により、ミトコンドリア、原核生物、真核生物の塩基配列が、従来の手法より高い自然さと整合性を持って、ゲノムスケールで生成された。Evo 2はさらに、予測モデルと推論時の探索による誘導の下で、実験的に検証されたクロマチンアクセシビリティーパターンも生成した。我々は、生物学的複雑性の探索と設計を加速させる目的で、モデルパラメーター、訓練コード、推論コード、OpenGenome2データセットを含め、Evo 2を完全に公開している。

目次へ戻る

プライバシーマーク制度