画像生成AI
画像生成AIとは、テキストプロンプトなどの指示を入力するだけで、自動的に新しい画像を創り出す人工知能技術です。ディープラーニングを活用し、イラストから写真風の画像まで多様な表現を短時間で作成できるため、デザインやエンターテインメントなど幅広い分野で広く活用が進んでいます。
AI用語一覧を501件掲載しています。気になるAI用語の意味や使い方を確認できます。 現在は7ページ目です。
画像生成AIとは、テキストプロンプトなどの指示を入力するだけで、自動的に新しい画像を創り出す人工知能技術です。ディープラーニングを活用し、イラストから写真風の画像まで多様な表現を短時間で作成できるため、デザインやエンターテインメントなど幅広い分野で広く活用が進んでいます。
ボイスクローニングとは、AI技術を用いて特定の人物の音声を学習し、その人そっくりの声色や話し方を再現する技術です。数秒から数分程度の音声サンプルがあれば高精度な合成音声を作り出せるため、エンタメやアクセシビリティ分野で活用が期待されています。
敵対的生成ネットワーク(GAN)は、生成器と識別器という2つのAIモデルを競い合わせることで、高精度な画像やデータを自動生成するディープラーニングの枠組みです。1人のアーティストと1人の鑑定士が競うように学習し、本物そっくりな偽物を作り出します。
オートエンコーダは、入力データを一度次元削減して圧縮し、再び元のデータに復元するプロセスを学習する教師なし学習のニューラルネットワークです。データの持つ本質的な特徴抽出や異常検知、ノイズ除去に広く活用されています。
多層パーセプトロン(MLP)は、入力層、隠れ層、出力層の複数の層から構成される基本的な人工ニューラルネットワークです。非線形なデータの関係性を学習できるため、現代の深層学習の基礎となる重要なアーキテクチャです。
ロジスティック回帰とは、データが特定のクラスに属する確率を予測するための代表的な機械学習アルゴリズムです。名前は回帰ですが、実際にはスパムメールの判定や病気の有無といった「分類問題」を解決するために広く使われる基本手法です。
ソフトマックス関数とは、複数の数値を合計が1になる確率のような分布へと変換する活性化関数です。主にニューラルネットワークの出力層で使われ、多クラス分類問題において各クラスに属する確率を算出する際に重要な役割を果たします。
ダイイングReLU問題とは、ディープラーニングの活性化関数であるReLUにおいて、ニューロンの出力が常にゼロになり更新されなくなる現象です。学習中に大きな勾配が流れると重みが負の領域に固定され、ニューロンが実質的に死亡してモデルの表現力が低下します。これを防ぐためにLeaky ReLUなどの派生関数が用いられます。
逆誤差伝播法とは、ニューラルネットワークの学習において、出力された予測値と正解との誤差をネットワークの逆向きに伝播させ、各パラメータを効率的に更新するためのアルゴリズムです。深層学習の急速な発展を支えた最も重要な基盤技術の一つです。
勾配爆発問題とは、深層学習の学習時に誤差逆伝播法を通じて算出される勾配が過度に巨大化し、パラメータの更新が不安定になる、あるいは破綻する現象です。特にRNNなどの深いネットワークで起こりやすく、モデルの学習が正常に進まなくなる重大な課題の一つです。
正規化(Normalization)とは、データの各特徴量のスケール(値の範囲)を統一する処理のことです。主にデータを0から1の範囲に変換することで、特定の変数の影響力が不当に大きくなるのを防ぎ、機械学習モデルの学習を安定化・高速化させます。画像処理や自然言語処理など、多様なAI分野のデータ前処理において必須のプロセスです。
技術的特異点とは、人工知能が人間の知性を超えることで、文明の進化速度が無限大になり、これまでの予測が不可能になる転換点のことです。AIの自律的な自己改良や超知能の誕生を背景に、未来予測の境界線として議論されています。
AIアライメント問題とは、人工知能の目標や行動が人間の意図や倫理観、価値観と一致するように制御することが困難であるというAI安全性における課題です。AIの性能が向上するほど、予期せぬ行動や誤った最適化のリスクが高まるため、重要な研究分野となっています。
カーネルとは、非線形なデータを高次元空間に写像することで、線形分離が困難な問題を取り扱いやすくする機械学習の重要な概念です。主にサポートベクターマシンなどで利用され、複雑なパターンの識別を効率的に行います。
受容野とは、畳み込みニューラルネットワークにおいて、特定のニューロンが入力データのどの範囲の情報に影響を受けるかを表す領域のことです。層を深く重ねることで受容野は広がり、局所的な特徴から画像全体の大域的な特徴へと理解が深まります。モデルの認識性能や設計に直結する重要な概念です。
パディングとは、機械学習やディープラーニングの入力データや特徴量マップの周囲に、0などの特定の値を補う処理です。画像処理では画像の端の情報ロスを防ぎ、自然言語処理では文章の長さを揃えるために必須の技術です。
アベレージプーリングは、畳み込みニューラルネットワークにおいて特徴マップの局所的な領域の平均値を計算し、データサイズを縮小するプーリング処理手法です。画像の解像度を下げて計算量を削減しつつ、全体的な特徴を保持する役割を持ちます。
ニューロンとは、脳の神経細胞を模した人工知能の基本単位です。複数の入力信号を受け取り、一定の条件を満たした場合にのみ次の信号を出力する仕組みを持ち、人工ニューラルネットワークの基礎として多くのAI技術に応用されています。
アルゴリズムとは、コンピューターが特定の問題を解決したり、計算や処理を実行したりするための明確な手順やルールのことです。AIの基盤となる機械学習モデルの学習や推論プロセスにおいても、効率的な計算を行うための中心的な役割を担っています。
カラー量子化とは、画像内で使われている膨大な色数を、人間の視覚特性に配慮しつつ少数の代表色(パレット)へと削減する画像処理技術です。画質劣化を最小限に抑えながら画像データのファイルサイズを大幅に削減できるため、画像圧縮やWeb最適化において重要です。機械学習アルゴリズムであるk-means法などが代表色の選定に広く応用されています。
階層型クラスタリングは、データ間の類似度をもとに木構造の階層を作り、データをグループ化する教師なし学習の手法です。事前のクラスター数を指定する必要がなく、デンドログラムによって視覚的に関係性を確認できる点が特徴ですが、大規模データでは計算量が増大する課題があります。
未ラベルデータとは、正解を示す教師データ(ラベル)が付与されていないデータの総称です。AIの開発や機械学習において、コストをかけずに大量収集できるため、教師なし学習や半教師あり学習などで活用が期待されています。
教師データとは、AIや機械学習モデルに正解の出力例を学習させるためのデータです。入力データとその正解の組み合わせで構成され、AIがパターンや規則性を習得して予測や分類を行うための基盤となります。精度の高いモデル開発には、量と質の両方が求められます。
線形判別分析(LDA)は、教師あり学習の次元削減および分類手法の一つです。データがどのグループに属するかを最もよく区別できるように、新しい軸(超平面)を見つけてデータを射影します。クラス間の分散を最大化し、クラス内の分散を最小化するように線形結合を計算するため、データの可視化や前処理に広く活用されています。