機械学習:光を用いた生成モデル
Nature 644, 8078 doi: 10.1038/s41586-025-09446-5
生成モデルは、画像や動画の合成、自然言語処理、分子設計を含め、多様な応用分野を対象範囲としている。デジタル生成モデルが大規模化していくにつれ、高速でエネルギー効率の高いスケーラブルな推論が課題になっている。今回我々は、拡散モデルから着想を得た光を用いた生成モデルを提案する。このモデルでは、浅く高速なデジタルエンコーダーがまずランダムな雑音を位相パターンに変換し、このパターンが、所望のデータ分布に対応する光生成シードとして機能する。共同訓練された自由空間ベースの再構成可能なデコーダーが、これらの生成シードを全て光処理して、目標のデータ分布に従うこれまで見たことのない画像を生成する。浅いエンコーダーによる照明パワーと乱数シードの発生を除き、これらの光生成モデルは画像合成中に計算パワーを消費しない。我々は、MNIST、Fashion-MNIST、Butterflies-100、Celeb-Aデータセット、ファン・ゴッホの絵画とスケッチのそれぞれのデータ分布に従った、手書き数字、ファッション製品、チョウ、人間の顔、芸術作品の単色画像および多色画像の光生成について報告する。得られた全体的な性能は、デジタルニューラルネットワーク系の生成モデルとほぼ同等であった。我々は、光生成モデルを実験により検証するために、可視光を用いて手書き数字とファッション製品の画像を生成した。加えて、単色照明と多波長照明の両方を使用して、ファン・ゴッホ風の芸術作品を生成した。これらの光生成モデルは、エネルギー効率が高くスケーラブルな推論タスクを実現する道筋を開く可能性があり、人工知能生成コンテンツにおける光学とフォトニクスの潜在能力をさらに活用するものである。

