Article

機械学習:小規模データを正確に予測する表形式基盤モデル

Nature 637, 8045 doi: 10.1038/s41586-024-08328-6

行と列で構成された表形式データであるスプレッドシートは、生物医学から素粒子物理学、経済学、気候科学に至るまで、科学分野全体で普遍的に使われている。欠落した列ラベルの値を残りの列に基づいて埋めるという基本的な予測タスクは、生物医学的リスクモデル、創薬、材料科学などの多様な用途に不可欠である。ディープラーニングは、生データからの学習を一変させ、数々の注目される成功談が知られているが、表形式データでは過去20年間、勾配ブースティング決定木が圧倒的に優位であった。今回我々は、最大1万サンプルのデータセットにおいて、これまでのあらゆる手法を大差で凌駕し、訓練時間が大幅に短い表形式基盤モデルである、TabPFN(Tabular Prior-data Fitted Network)を提示する。TabPFNは2.8秒で、分類設定において4時間チューニングされた最強のベースラインのアンサンブルを凌駕した。またこのモデルは、ジェネレーティブトランスフォーマーに基づく基盤モデルとして、微調整、データ生成、密度推定、再利用可能な埋め込みの学習も可能である。TabPFNは、それ自体が何百万もの合成データセットにわたって学習される学習アルゴリズムであり、アルゴリズム開発に向けたこの手法の威力を実証している。TabPFNは、多様な分野にわたるモデル化能力を向上させることによって、科学的発見を加速し、さまざまな領域における重要な意思決定を強化する可能性を秘めている。

目次へ戻る

プライバシーマーク制度