ランドマークとは、コンピュータビジョンや画像認識において、画像内の特徴的な基準点(目印)を指す技術用語です。顔認識における目や口の端、あるいは骨格検出における関節の位置などの座標情報として定義されます。物体の形状や姿勢、表情を正確に捉えるために、ディープラーニングなどの機械学習モデルを通じて自動的に検出されます。
ランドマークとは
ランドマーク(特徴点)とは、画像認識やコンピュータビジョンにおいて、検出対象(顔や身体など)の構造を定義する「位置の基準となる目印(座標点)」のことです。
詳しく解説
ランドマークは、画像処理やディープラーニングモデルにおいて、対象物の形状や姿勢を把握するために用いられます。例えば、顔認識では数十〜数百個の点が目、眉、鼻、口、輪郭に配置され、表情の分析や顔の向きの検出に利用されます。機械学習モデルは画像を入力として受け取り、これらのランドマークのX・Y座標(3次元の場合はZ座標も含む)を出力するように訓練されます。これにより、画像内の対象物がどのように変形・移動しているかを定量的に把握できます。
具体例・使われ方
具体的な利用例として、スマートフォンのカメラアプリによる美顔フィルターや、拡張現実(AR)によるデジタルメイクが挙げられます。ユーザーの顔のランドマークをリアルタイムで追跡し、目にアイラインを引いたり、頭部にキャラクターの耳を正確に合成したりします。また、骨格検出(ポーズ推定)では、肘や膝などの関節位置をランドマークとして検出することで、スポーツのフォーム解析や、ゲームのモーションキャプチャに利用されます。
似た用語との違い
ランドマークとバウンディングボックスは混同されやすいですが、役割が異なります。バウンディングボックスは画像内の対象物を囲む「矩形(四角い枠)」であり、大まかな位置と範囲を示します。一方、ランドマークは対象物の内部にある「特定の局所的な点(座標)」をピンポイントで示し、より詳細な形状や姿勢、表情を捉えるために使われます。
注意点
ランドマーク検出の限界として、対象物が障害物に隠れるオクルージョンが発生した場合に、精度が著しく低下する点が挙げられます。例えば、手で顔を覆ったり、横を向いたりして目や鼻が隠れると、モデルは正しい座標を予測できなくなります。また、顔や身体の形状は個人差が大きいため、多様なデータで訓練されていないモデルでは、特定の肌の色や年齢層、骨格に対して検出精度が偏るバイアスが生じるリスクがあります。