構造化予測
構造化予測とは、単一のスカラー値ではなく、木構造やグラフ、系列データといった複雑で相互依存関係にある出力構造を一度に予測する機械学習の手法です。自然言語の構文解析や画像セグメンテーションなどで広く活用されています。
AI用語一覧を509件掲載しています。気になるAI用語の意味や使い方を確認できます。 現在は9ページ目です。
構造化予測とは、単一のスカラー値ではなく、木構造やグラフ、系列データといった複雑で相互依存関係にある出力構造を一度に予測する機械学習の手法です。自然言語の構文解析や画像セグメンテーションなどで広く活用されています。
逐次ラベル付けとは、自然言語処理などの連続的なデータにおいて、前後の文脈を考慮しながら系列内の各要素に対して順序立ててラベルを付与する機械学習のアプローチです。
ビタビアルゴリズムは、観測された系列データから、最も確からしい隠れた状態の系列を効率的に見つけ出す動的計画法に基づくアルゴリズムです。隠れマルコフモデルなどの確率モデルにおいて、音声認識や形態素解析などに広く利用されています。
コーパスとは、自然言語処理やAIの学習・研究のために、言語の実際の使用例を大量に収集し、構造化・整理したテキストデータ群のことです。文章や会話データを目的別に分類し、品詞などの情報(メタデータ)を付与することで、大規模言語モデルの事前学習や言語分析に利用されます。
強化学習とは、AIが試行錯誤を通じて最適な行動パターンを学習する機械学習の手法です。環境内で「エージェント」が行動を選択し、その結果に応じて得られる「報酬」を最大化するように学習が進みます。正解データが事前に与えられなくても自発的に成果を高める行動を学べるため、ゲーム攻略や自動運転、ロボット制御などの分野で活用されています。
最尤推定とは、観測されたデータから、それが生成される確率が最も高くなるようなパラメータを逆算する統計的な推計手法です。機械学習のモデル学習やパラメータ推定において、確率モデルの最適な設定値を求めるための基礎技術として広く利用されています。
ガウス分布とは、平均値の周囲にデータが左右対称の鐘型曲線を描いて集まる確率分布のことです。正規分布とも呼ばれ、自然界や社会現象、機械学習の誤差モデルなどで広く利用される統計学の基本概念です。
生成系AIとは、テキスト、画像、音声、動画などの新しいコンテンツを自動的に作り出す人工知能技術のことです。大量のデータからパターンを学習した機械学習やディープラーニングのモデルを基盤とし、ユーザーが入力した指示に応じて柔軟にアウトプットを出力します。従来の分析・識別中心のAIとは異なり、クリエイティブな作業や業務の効率化を大幅に支援する技術として注目されています。
中心極限定理とは、確率変数の平均が、元の分布にかかわらずサンプルサイズが大きくなるにつれて正規分布に近づくという確率論の基本定理です。AIや機械学習において、データの誤差分析や統計的検定、モデルの信頼区間を算出する際の理論的根拠として非常に重要な役割を果たしています。
カテゴリ分布とは、互いに排反な複数の離散的な選択肢のいずれかが発生する確率を表す確率分布です。機械学習の分類問題などで、出力やデータの偏りを表現するために広く用いられる基本的な概念です。
多項分布は、3つ以上の排反な結果を持つ試行を独立に複数回繰り返したとき、それぞれの結果が何回発生するかを記述する確率分布です。自然言語処理の分野で文書分類やナイーブベイズ分類器などに広く活用されています。
多クラス分類とは、データが3つ以上のカテゴリのどれに属するかを予測する機械学習のタスクです。犬や猫、鳥など複数の選択肢から正解を1つ選ぶ問題などで広く利用され、画像認識や自然言語処理の基礎となる重要な技術です。
回帰問題とは、機械学習において連続的な数値(数量や変化量など)を予測するタスクのことです。過去のデータに基づいて、気温や売上、住宅価格などの連続した値を推定する際に用いられます。正解データとして数値を与える教師あり学習の一種であり、分類問題と並んで機械学習の基礎的かつ重要な問題設定の一つです。
不均衡データとは、機械学習の分類問題において、特定のクラスに属するデータ数が他のクラスに比べて極端に少ない状態を指します。そのままでは多数派の予測ばかりを学習してしまうため、適切な前処理やモデルの調整が必要です。
識別器とは、入力されたデータがどのカテゴリに属するかを判定する機械学習アルゴリズムやモデルのことです。画像認識やスパムメール判定など、AIのさまざまな分類タスクにおいて中心的な役割を果たしています。
生成AIが多様な出力を失い、特定のパターンや似たような結果ばかり生成してしまう現象のことです。特に敵対的生成ネットワークの学習時によく発生し、モデルの表現力が著しく低下する課題として知られています。
ディフュージョンモデルは、データにノイズを加える過程とそれを取り除く逆過程を学習し、ランダムノイズから高品質なデータを創り出す生成AI技術です。GANやVAEなどの従来手法に比べて学習が安定し、極めて高精細な画像生成などを実現できます。画像生成AIの根幹を支える技術として広く活用されています。
誤差逆伝播法とは、ニューラルネットワークの学習において、出力された予測値と正解との誤差を計算し、その情報を出力層から入力層に向かって逆向きに伝えることで、各パラメータを効率的に更新するアルゴリズムです。深層学習の発展に不可欠な技術であり、多層のネットワークでも高速に学習を収束させることを可能にしました。
線形モデルは、入力(説明変数)と出力(目的変数)の関係を足し算の形式で表す、機械学習や統計学における基本的なモデルです。構造がシンプルなため計算負荷が小さく、予測の根拠となる各特徴量の影響度を数値で把握できる高い解釈性を持っています。回帰分析やロジスティック回帰などで幅広く活用されており、データ分析の基準となる重要なアプローチです。
未学習とは、AIモデルやニューラルネットワークがデータによるトレーニングを一度も受けておらず、重みやパラメータが初期化されたままの状態を指します。学習データの特徴や規則性を獲得していないため、適切な予測や生成を行うことはできません。機械学習の出発点であり、事前学習を行う前提となる状態です。
再帰型ニューラルネットワーク(RNN)は、時系列データや文章などのシーケンスデータを扱うために設計されたディープラーニングの基本モデルです。過去の情報を内部状態として保持し、次の入力へ引き継ぐ再帰構造を持つため、データの前後関係や文脈を考慮した高度な予測や解析が可能です。テキスト生成や音声認識など幅広い分野で利用されています。
勾配クリッピングは、ニューラルネットワークの学習時に発生する勾配爆発を防ぐため、算出された勾配の大きさに閾値を設けて制限する技術です。過度に大きな勾配を切り詰めることで、パラメータの更新を安定させ、学習を正常に収束させることができます。
ビッグデータとは、従来のデータベース処理技術では管理や解析が困難な、巨大で複雑かつ多様なデータ群のことです。単に容量が大きいだけでなく、更新頻度の高さやデータの多様性が特徴です。AIや機械学習の精度向上、新たなビジネス価値の創出、迅速な意思決定において極めて重要な基盤として活用されています。
特徴量スケーリングとは、機械学習のデータ前処理において、異なる単位や数値の範囲(スケール)を持つ特徴量を一定の基準で揃える処理です。データの尺度差による偏りを防ぎ、モデルの予測精度向上や学習の高速化を可能にします。代表的な手法として、平均を0、分散を1にする「標準化」や、データを0から1の範囲に収める「正規化」があります。