敵対的例とは、機械学習モデルの予測を誤らせるために意図的に微小な変更を加えた入力データのことです。人間には元のデータと区別がつかないわずかなノイズでありながら、AIには誤認を引き起こすため、AIシステムの脆弱性やセキュリティリスクとして注目されています。
敵対的例とは
一言でいうと、AIの誤作動を狙って人間には分からない程度に少しだけ改変された入力データのことです。
詳しく解説
敵対的例は、機械学習モデルが持つ高次元空間での連続性や、学習データのわずかな偏りを突いて生成されます。人間にとっては何の変哲もない画像や音声であっても、モデルにとっては決定的な違いとなり、全く異なるクラスへ分類させてしまいます。例えば、パンダの画像にわずかなノイズを重ねるだけで、モデルがそれをテナガザルと確信して判定する現象などが有名です。この仕組みはAIの頑健性を評価する上で非常に重要であり、モデルの弱点を補強するための研究が進められています。
具体例・使われ方
具体的な例として、自動運転車のカメラシステムにおいて、道路標識にわずかなステッカーやペイントを貼り付けることで、AIに「制限速度30km」の標識を「一時停止」と誤認させる攻撃があります。また、音声認識システムに対して、人聞きには雑音にしか聞こえない音声を入力し、AIだけに意図した別の言葉を認識させる手法も敵対的例の一種です。
似た用語との違い
通常のデータノイズが偶然による誤作動を引き起こすランダムなものであるのに対し、敵対的例は攻撃者や研究者がモデルを騙す目的で数学的に計算して意図的に作り出す点が大きく異なります。
注意点
敵対的例は現実世界のAIシステムに対する重大なセキュリティ上の脅威となります。防衛策として敵対的訓練などが提案されていますが、新たな手法による攻撃とのイタチごっこになっており、完全に防ぐことは依然として困難です。