分布内データとは、機械学習モデルが訓練時に学習したデータと同じ統計的性質や確率分布に従うデータのことです。モデルが本来の予測精度や汎化性能を正しく発揮するための前提となるデータであり、テストや運用時にこの範囲内のデータが与えられることで、モデルは信頼性の高い結果を出力できます。
分布内データとは
分布内データとは、機械学習モデルの訓練に使用されたデータと同じ確率分布に従うデータのことです。
詳しく解説
機械学習モデルは、与えられた学習データの特徴やパターンを統計的に捉えることで予測や識別を行います。モデルが意図通りの高い精度を発揮するためには、評価時や運用時に入力されるデータが、訓練時の学習データと同じ統計的性質や傾向を持つ分布内データであることが前提となります。運用時のデータがこの範囲内に収まっている場合、モデルは学習成果を効果的に発揮でき、優れた汎化性能を示します。一方、分布が異なるデータが入力されるとモデルの予測信頼性は著しく低下するため、データが分布内データであるかを見極めることが機械学習システム構築において重要です。
具体例・使われ方
たとえば、日本の街並みの写真のみで学習させた自動運転用の画像認識モデルに対して、同様の日本の晴天時の街並み写真をテスト入力として与える場合、その写真は分布内データとなります。また、過去の顧客の購買履歴データを用いて訓練された推奨システムに対して、同じ対象期間・属性の顧客データを入力する場合も分布内データの具体例です。
似た用語との違い
対照的な概念として「分布外データ」があります。分布内データが訓練データと同じ確率分布に基づくデータであるのに対し、分布外データは訓練データとは異なる統計的分布を持つデータを指します。機械学習モデルは分布内データに対して高い精度を保ちますが、分布外データが入力されると過剰な自信をもって誤予測を起こすリスクがあります。
注意点
分布内データに対してモデルが非常に高い精度を示していても、それが訓練データの暗記による過学習の結果ではないか確認する必要があります。また、現実世界のデータ傾向は時間の経過や環境の変化に伴って変化するため、開発時点では分布内データであったものが運用期間中に分布外へシフトする可能性がある点に注意が必要です。