ソースドメインとは、機械学習においてモデルの学習や知識の抽出に用いられる元のデータ領域や環境のことです。転移学習などにおいて、十分にデータが揃った環境を指し、そこで得た知識を別のターゲットドメインへ応用するために活用されます。
ソースドメインとは
一言でいうと、機械学習のモデルが最初に学習を行うために使用する、データが十分に存在する元の領域のことです。
詳しく解説
ソースドメインは、転移学習やドメイン適応の文脈で頻繁に使用される概念です。一般的に機械学習を行う際には、十分な量のラベル付きデータが必要となりますが、特定の分野ではそれが手に入らないことがあります。そこで、豊富なデータを持つソースドメインでモデルをあらかじめ十分に学習させ、その学習済みモデルや抽出された特徴量を、データが不足しているターゲットドメインへと転用します。これにより、一から学習させるよりも高い精度を効率的に達成することが可能になります。
具体例・使われ方
例えば、大量の一般的な画像データが集まっているデータセットをソースドメインとし、そこで学習させた画像認識モデルを、医療現場の特殊な画像であるターゲットドメインの診断支援に応用する場合などが挙げられます。また、現実世界のシミュレーション環境をソースドメインとしてエージェントを訓練し、得られた知識を実際の現実環境であるターゲットドメインへ適用する際にも利用されます。
似た用語との違い
学習の対象先である「ターゲットドメイン」とは対になる概念です。ソースドメインは知識の提供元であり、ターゲットドメインは知識の適用先となります。また、学習の元となるデータセットそのものを指す場合もありますが、ドメイン適応では確率分布の違いを意識して使われます。
注意点
ソースドメインで学習した知識がどれほど優れていても、ターゲットドメインとのデータの傾向や分布に大きな乖離がある場合、負の転移を引き起こし、かえってモデルの精度が低下する恐れがあります。そのため、ドメイン間の差異を適切に調整する技術が必要となります。