敵対的攻撃
敵対的攻撃とは、AIや機械学習モデル(特に深層学習)に対して、人間には判別できないほどの微小なノイズや細工を加えた入力(敵対的サンプル)を与えることで、モデルに意図的な誤認識や誤分類を起こさせるサイバー攻撃の手法です。AIの脆弱性を突くセキュリティ上の重大な脅威として、現在盛んに研究されています。
機械学習に関するAI用語を348件掲載しています。意味や使い方、関連用語を一覧から確認できます。 現在は11ページ目です。
敵対的攻撃とは、AIや機械学習モデル(特に深層学習)に対して、人間には判別できないほどの微小なノイズや細工を加えた入力(敵対的サンプル)を与えることで、モデルに意図的な誤認識や誤分類を起こさせるサイバー攻撃の手法です。AIの脆弱性を突くセキュリティ上の重大な脅威として、現在盛んに研究されています。
最適化とは、与えられた制約条件の下で、特定の目的関数を最大化または最小化する最適な解決策を見つけ出すプロセスです。AIの分野、特に機械学習においては、モデルの予測誤差を最小化するために「損失関数」を減少させるパラメータ(重みやバイアス)を探索するプロセス(勾配降下法など)を指し、学習の根幹を支えています。
状態価値関数とは、強化学習において、エージェントがある特定の状態にいるとき、その後に得られる将来の累積的な報酬の期待値を表す関数です。特定の方策に従って行動した際に、その状態がどれだけ有利であるかを定量化します。意思決定の基準となる重要な概念であり、最適な行動方針を導き出すための基盤として機能します。
平均二乗誤差とは、予測値と実際の値のずれを評価するための損失関数のひとつです。予測の正確さを数値化するために機械学習の回帰モデルで広く使われており、誤差を二乗して平均をとることで大きなズレをより強くペナルティとして課す特徴を持ちます。
ワンホット表現とは、機械学習や自然言語処理においてカテゴリカルデータを数値のベクトルに変換する手法です。対象のカテゴリに該当する1箇所のみを「1」とし、他を「0」にするベクトルで表します。カテゴリ間の擬似的な順序関係を排除できるメリットがある一方、項目数が増えるとベクトルの次元数が膨大になり、意味の類似度を表現できないという限界もあります。
局所最適解とは、最適化問題において特定の狭い範囲内では最も良い解(極小値や極大値)であるものの、問題全体における最善の解(全域最適解)ではない状態やその解のことです。機械学習のモデル訓練では、勾配降下法などで損失関数を最小化する際に局所最適解に陥り、学習が途中で停滞してしまう課題が知られています。
機械学習のモデル学習において、損失関数を最小化するための最適化アルゴリズム。全データではなくランダムに抽出した一部のデータを用いてパラメータを更新することで、計算コストを大幅に削減し、大規模なデータセットでも効率的な学習を可能にする基本的な手法。
Pythonは、シンプルで読みやすい文法と豊富なエコシステムを持つプログラミング言語です。NumPyやPyTorchといった強力なライブラリやフレームワークが充実しているため、機械学習やディープラーニング、データ分析の分野で事実上の標準言語として広く活用されています。
推論処理とは、大量のデータによって事前学習されたAIモデルに対し、新しいデータを入力して予測や分類、生成などの出力結果を得る計算プロセスのことです。AIの運用フェーズにおいて実際にサービスを提供する段階で実行され、画像認識や文章生成などのさまざまなAI応用機能の基盤となっています。
変分オートエンコーダーは、確率分布を利用してデータを低次元の潜在空間に圧縮し、新しいデータを生成するディープラーニング手法です。従来のオートエンコーダーとは異なり、データを連続的な空間として表現するため、滑らかなデータ補間や安定した画像生成が可能です。異常検知や画像生成など多様な分野で応用されています。
超平面とは、n次元空間を2つに仕切るn-1次元の領域であり、機械学習ではデータを分類する決定境界として活用されます。例えば2次元での直線、3次元での平面に相当します。サポートベクターマシンなどの線形分離モデルで用いられ、複雑な特徴量空間内のデータを精度高く二分するために不可欠な数学的概念です。
ダウンサンプリングとは、デジタルデータや信号の解像度やサンプル数を減らしてデータ量を削減する処理のことです。AIや機械学習の分野では、画像処理の軽量化や、不均衡データに対するデータ調整の手法として広く活用されています。
バッチ処理とは、蓄積された複数のデータを一定のまとまり(バッチ)にして、一括で効率的に処理する仕組みです。AI分野では、大規模なデータセットを用いた機械学習モデルの訓練などで広く活用されています。
サポートベクターマシン(SVM)は、高精度な分類や回帰を実現する教師あり学習の機械学習アルゴリズムです。データ群を最も明確に分割する境界線を引く「マージン最大化」という考え方を基本とし、高次元のデータでも優れた識別能力を発揮します。画像認識やテキスト分類など、多様な分野で広く活用されています。
欠損値とは、データセットの中でデータが記録されていない、あるいは存在しない値のことです。機械学習のモデルを訓練する前に適切な前処理を行わないと、予測精度の低下や学習エラーの原因となります。
機械学習においてノイズとは、データに含まれる本来の不要な不純物や歪みのことです。学習の妨げとなり、モデルの精度低下や過学習を引き起こす要因となります。一方で、画像生成に用いられる拡散モデルのように、あえてノイズを利用して新しいデータを生成する技術も存在します。適切な前処理によりこれらを除去・制御することがAI開発において極めて重要です。
中間層とは、人工ニューラルネットワークにおいて入力層と出力層の間に位置する階層の総称です。入力されたデータから複雑な特徴やパターンを自動的に抽出し、高度な判断や予測を行うためのディープラーニングの根幹を担う重要な仕組みです。
勾配下降法とは、機械学習やディープラーニングにおいてモデルの予測誤差を最小化するために用いられる代表的な最適化アルゴリズムです。損失関数の勾配(傾き)を計算し、誤差が最も小さくなる方向へモデルのパラメータを少しずつ更新します。効率的な学習を実現するための基礎となる重要な技術です。
エンコーダとは、入力されたデータをコンピュータが処理しやすい形や別の表現に変換する仕組みのことです。自然言語処理や画像認識などのAI分野で広く活用されており、データの意味や特徴を効率的に抽出する役割を担っています。
二項分布とは、互いに独立した「成功か失敗か」の2通りの結果しか得られない試行(ベルヌーイ試行)を一定回数繰り返したとき、成功する回数の確率分布を示す離散確率分布です。AIや機械学習の分野では、2値分類モデルの評価やデータサンプリングの理論的裏付け、あるいはABテストの有意差検定などに幅広く応用されています。
平均値とは、データの総和をデータ数で割って得られる統計的な代表値のことです。機械学習やデータ分析では、データセット全体の傾向を把握したり、モデルの予測誤差を評価する指標として頻繁に使用されます。異常値の影響を受けやすい特徴がありますが、データの中心的な位置を直感的に捉える基本的な尺度として重要です。
系列データとは、順序や前後の文脈が重要な意味を持つデータの総称です。時系列データや自然言語の文章、音声などが該当し、AIの分野ではリカレントニューラルネットワークやトランスフォーマーなどのモデルを用いて処理されます。
マルコフ性とは、あるシステムの「未来の状態」の確率分布が「現在の状態」のみに依存し、それ以前の過去の履歴には依存しないという確率過程の性質です。過去の経緯をすべて記憶しなくても現在の情報だけで未来を予測・制御できるため、強化学習やマルコフ決定過程をはじめとする機械学習モデルの設計や解析において極めて重要な前提概念となっています。
頻度主義とは、確率を「無限に試行を繰り返したときに、ある事象が発生する相対的な割合(頻度)」として客観的に定義する統計学の立場です。客観的なデータに基づき、パラメータを固定された未知の真値として扱うのが特徴です。機械学習やデータ分析における仮説検定やA/Bテスト、最尤推定などの基礎となっています。