拡散モデルとは?
かくさんもでる
拡散モデルとは、データにノイズを段階的に加える過程を学習し、ノイズから元のデータを復元する逆過程で画像や音声などを生成する深層学習モデルです。
拡散モデル(Diffusion Model)とは、データに少しずつノイズを加えて完全なランダムノイズにする「拡散過程」と、その逆にノイズからデータを段階的に復元する「逆拡散過程」の両方をニューラルネットワークで学習する生成モデルの一種です。2020年のDDPM(Denoising Diffusion Probabilistic Models)論文で脚光を浴び、画像生成の主流技術となりました。
直感的には「白砂に描かれた絵が砂嵐で少しずつ消えていく過程」を逆再生することで絵を描く、と表現できます。モデルは各ステップでノイズがどう加わったかを学習するため、生成時は純粋なランダムノイズから出発して繰り返しノイズ除去を行うことで高品質な画像が得られます。
拡散モデルの主な特徴は以下の通りです。
- GANと比較してモード崩壊が少なく、多様で高品質なサンプルを生成できる
- テキスト条件付け(テキストから画像生成)との相性が良い
- 画像の一部を修正するインペインティングにも応用可能
- 音声・動画・分子構造など幅広いデータ形式への応用が進んでいる
Stable Diffusion・DALL-E・Imagen・Midjourneyなどの著名な画像生成AIは拡散モデルを核としています。潜在空間で拡散を行う潜在拡散モデル(Latent Diffusion Model)は計算効率を大幅に改善し、商用・研究での活用を加速させました。
使い方・例文
「夕焼けの富士山、水彩画スタイル」というテキストを入力すると、AIが純粋なノイズから何十ステップもかけてノイズを除去しながら画像を生成する仕組みが、拡散モデルの典型的な使われ方です。
この用語をシェア
最終更新: