正則化
正則化とは、機械学習モデルが訓練データだけに過度に適応してしまう「過学習」を防ぎ、未知のデータに対する予測性能を高めるための手法です。モデルの複雑さにペナルティを課すことでパラメータの極端な増大を抑え、よりシンプルなモデルへと誘導します。L1正則化やL2正則化、ドロップアウトなどの手法が存在します。
機械学習に関するAI用語を216件掲載しています。意味や使い方、関連用語を一覧から確認できます。 現在は2ページ目です。
正則化とは、機械学習モデルが訓練データだけに過度に適応してしまう「過学習」を防ぎ、未知のデータに対する予測性能を高めるための手法です。モデルの複雑さにペナルティを課すことでパラメータの極端な増大を抑え、よりシンプルなモデルへと誘導します。L1正則化やL2正則化、ドロップアウトなどの手法が存在します。
テストデータは、機械学習モデルの最終的な予測精度や汎用性を客観的に評価するために使用される未学習のデータセットです。学習データや検証データとは明確に分離され、モデルが未知のデータに対してどの程度正しく予測できるか(汎化性能)を評価するために欠かせない役割を果たします。
訓練データとは、機械学習モデルがパターンや規則性を学習するために使用されるデータ群です。AIの精度や性能を左右する基礎となり、適切な品質と量の確保が不可欠です。
教師なし学習とは、正解データ(ラベル)を与えずに、AIが入力データの構造や特徴パターンを自律的に発見・学習する機械学習の手法です。クラスタリングや次元削減などに用いられ、大量の未ラベルデータから潜んでいる法則性やグループを見つけ出す際に威力を発揮します。顧客セグメンテーションや異常検知などで活用されています。
汎用型AI(AGI)とは、人間のように多様なタスクを理解し、学習し、自ら適応して問題を解決できる理想的な人工知能のかたちです。特定の作業に特化した現在の特化型AIとは異なり、あらゆる領域で人間と同等以上の知的な活動を行う能力を持ちます。
出力層とは、ニューラルネットワークの構造において、最終的な結果や予測を出力する一番最後の層のことです。入力データから中間層を経て抽出された特徴をもとに、分類や回帰などのタスクに応じた最終的な数値を算出し、AIモデルの判断を外部へ伝えます。
AIのサンプリングとは、確率分布に基づいて次に生成する単語やピクセルを確率的に選択する手法です。モデルの出力に多様性や創造性を与えるために重要な役割を果たし、温度パラメータなどを用いて出力のランダム性を調整できます。
エポックとは、機械学習やディープラーニングにおいて、訓練用データセット全体をモデルに1回学習させる単位のことです。データが1周学習されると「1エポック」とカウントされます。学習回数を適切に設定することで、AIモデルの予測精度を高めつつ、過学習や未学習を防ぐために重要なハイパーパラメータとして使用されます。
事前学習とは、AIモデルに特定のタスクを学習させる前段階として、大量のデータを用いて汎用的な知識やパターンを習得させるプロセスのことです。ディープラーニングや大規模言語モデルの開発において不可欠な手法であり、ゼロから学習させるよりも少ないデータと計算量で高精度なモデルを構築できる転移学習の基礎となっています。
データリーケージとは、機械学習モデルの訓練時に本来知り得ないテストデータや未来の情報が学習データに混入してしまう現象です。これにより訓練時の評価は高くなるものの、本番環境の未知のデータに対する予測性能が著しく低下します。モデル評価の信頼性を損なうため、適切なデータ前処理と厳格なデータ分割を行うことが極めて重要です。
分類とは、AIや機械学習において、入力されたデータがどのカテゴリやクラスに属するかを予測するタスクです。スパムメールの判定や画像の認識など、さまざまな分野の自動化や判断基準として広く利用されています。
ディープフェイクとは、ディープラーニング(深層学習)技術を用いて、実在する人物の顔や声を合成・改変して作られた偽の画像、動画、音声コンテンツのことです。映画の特殊効果やエンターテインメント領域で活用される一方で、なりすまし犯罪や誤情報の拡散など社会的なリスクが懸念されており、検知技術の向上や法的な対策が進められています。
クラスタリングとは、事前のアタリや正解ラベルがないデータ群の中から、特徴が似ているデータを自動的にグループ分けする機械学習の手法です。データ同士の類似度や距離を基に「クラスタ」と呼ばれる群を形成します。顧客データのグループ分けや文書分類、画像セグメンテーションなどに広く活用されています。
特異値分解(SVD)とは、行列を3つの特別な行列の積に分解する線形代数の手法です。任意の長方形行列に適用できる柔軟性を持ち、データの特徴抽出や次元削減、ノイズ除去に広く利用されます。AIや機械学習の分野では、推薦システムにおける潜在意味解析や画像圧縮、協調フィルタリングなどの基礎技術として重要な役割を果たしています。
ベイズ最適化とは、評価コストが高い未知の関数を最小限の試行回数で効率的に最適化する手法です。ガウス過程などの確率モデルで全体の傾向を予測し、獲得関数を用いて次に評価すべき点を決定します。機械学習モデルのハイパーパラメータ調整や実験計画の自動化など、試行に時間や費用がかかる分野で広く活用されています。
目的関数とは、機械学習や最適化問題において、モデルの予測精度やパフォーマンスを評価し、最適化の目標を数式として表した関数です。学習処理ではこの関数の値を最小化または最大化するようにパラメータを調整します。機械学習のタスクに応じて損失関数や評価関数、報酬関数などが使い分けられ、モデルの性能を左右する重要な役割を果たします。
交差エントロピー誤差は、機械学習モデルが出力した確率分布と正解データの確率分布との間の乖離を数値化する損失関数です。分類問題の学習において、モデルの予測精度を高めるための勾配降下法によるパラメータの更新に広く利用されています。
勾配降下法は、機械学習モデルの予測誤差を最小化するために、損失関数の勾配を利用してパラメータを少しずつ最適な値へ更新する最適化アルゴリズムです。山を下るように最も誤差が少ない状態を目指す仕組みであり、ディープラーニングを含む多くのAIモデルの学習プロセスにおいて基礎となる重要技術です。
潜在変数とは、データから直接観測することはできないものの、背後にある本質的な構造やメカニズムを説明するために仮定される変数です。機械学習や統計学において、複雑なデータの背後にある要因を見つけ出すために広く利用されています。
高次元データとは、多数の変数や特徴量を持つデータの総称です。AIや機械学習において表現力が向上する一方で、情報がまばらになり処理が困難になる次元の呪いという課題を引き起こすため、適切な前処理や次元削減が不可欠です。
線形判別分析(LDA)は、教師あり学習の次元削減および分類手法の一つです。データがどのグループに属するかを最もよく区別できるように、新しい軸(超平面)を見つけてデータを射影します。クラス間の分散を最大化し、クラス内の分散を最小化するように線形結合を計算するため、データの可視化や前処理に広く活用されています。
教師データとは、AIや機械学習モデルに正解の出力例を学習させるためのデータです。入力データとその正解の組み合わせで構成され、AIがパターンや規則性を習得して予測や分類を行うための基盤となります。精度の高いモデル開発には、量と質の両方が求められます。
未ラベルデータとは、正解を示す教師データ(ラベル)が付与されていないデータの総称です。AIの開発や機械学習において、コストをかけずに大量収集できるため、教師なし学習や半教師あり学習などで活用が期待されています。
階層型クラスタリングは、データ間の類似度をもとに木構造の階層を作り、データをグループ化する教師なし学習の手法です。事前のクラスター数を指定する必要がなく、デンドログラムによって視覚的に関係性を確認できる点が特徴ですが、大規模データでは計算量が増大する課題があります。