VAE(Variational Autoencoder)とは、入力データを圧縮して潜在空間に表現し、そこから新しいデータを生成する深層学習の生成モデルです。確率的なアプローチを用いることで、なめらかなデータの補間や多様な生成を実現します。
VAEとは
一言でいうとVAEとは、入力された画像などのデータを低次元の確率分布に変換して学習し、その分布からサンプリングすることで新しいデータを生み出す生成モデルのことです。
詳しく解説
VAEは、データをコンパクトに圧縮するエンコーダと、圧縮された潜在空間の表現から元のデータを復元するデコーダという2つのニューラルネットワークで構成されています。通常のオートエンコーダとは異なり、潜在空間の各変数を平均と分散を持つ確率分布として扱います。これにより、潜在空間が連続的で隙間のない空間になり、生成モデルとして新しいデータを安定して作り出すことが可能になります。学習時には再構成誤差と潜在空間の正則化項を同時に最適化する仕組みを採用しています。
具体例・使われ方
顔写真の画像を学習させて、笑顔の度合いや髪型を滑らかに変形させるような画像編集や、手書き文字の生成、異常検知の分野において正常なデータの特徴を学習するために利用されています。
似た用語との違い
GAN(敵対的生成ネットワーク)と比較されることが多く、GANが discriminator と generator の競合学習により非常に高精細な画像を生成する一方、VAEは確率モデルに基づくため学習が安定しやすく、データの確率的尤度を評価できるという特徴があります。
注意点
VAEの主な限界として、生成される画像がぼやけやすい(ブラー効果が生じる)という点が挙げられます。これは再構成誤差を最小化する過程で平均的な特徴を学習しやすいためであり、高精細な表現力を求める場合にはGANや拡散モデルなど他の生成モデルとの組み合わせや使い分けが必要です。