敵対的サンプルとは、ディープラーニングモデルを誤認させる目的で、人間には気付きにくい極小のノイズを加えた入力データのことです。画像認識において、パンダの画像に特殊なノイズを混ぜることで、AIに「テナガザル」と高確率で誤判定させる攻撃などが代表例です。AIのセキュリティや信頼性を評価する上で重要な概念です。
敵対的サンプルとは
敵対的サンプルとは、ディープラーニングなどの機械学習モデルに対して、人間には判別できないほど微細なノイズを加えることで、モデルに意図的な誤認識や誤分類を誘発させるように作られた入力データのことです。
詳しく解説
ディープラーニングモデルは、入力データのわずかな変化に対して脆弱な場合があります。敵対的サンプルは、モデルの意思決定境界の近くにあるデータに、数学的な最適化アルゴリズムを用いて計算された特定のノイズを付加することで作成されます。このノイズは人間の視覚や聴覚ではほぼ検知できませんが、ニューラルネットワークの計算過程で大きな誤差を発生させます。自動運転の道路標識認識システムを誤認させる攻撃や、音声認識システムに人間には聞こえない命令を混入させる攻撃などが研究されており、AIシステムのセキュリティ向上や、頑健性を評価・強化する観点から非常に重要視されています。
具体例・使われ方
代表的な例として、画像認識における攻撃が挙げられます。パンダの写真に特定の微細なノイズを合成すると、人間には全く同じパンダに見えるにもかかわらず、AIは「テナガザル」と99%以上の確信度で誤判定してしまいます。また、自動運転システムにおいて「一時停止」の標識に特殊なステッカーを貼ることで、AIに「速度制限」の標識と誤認させる実験や、人間の耳にはただの雑音に聞こえる音声データにコマンドを埋め込み、スマートスピーカーに不正な操作を行わせる音声攻撃などが知られています。
似た用語との違い
混同されやすい概念に「ノイズデータ」や「外れ値」があります。通常のノイズデータはランダムに発生する偶発的なデータの乱れであり、モデルの性能を多少下げることはあっても、意図的な誤作動を狙ったものではありません。一方で敵対的サンプルは、特定のモデルを意図的に誤認させるために悪意を持って計算・設計されたノイズである点が異なります。また、学習データそのものに毒を盛るデータポイズニングとも異なり、敵対的サンプルは学習が完了したシステム(推論フェーズ)に対して実行される攻撃です。
注意点
敵対的サンプルへの対策として敵対的学習などが進められていますが、完全な防御手法は確立されていません。また、あるモデルに対して作成された敵対的サンプルが、別の異なる構造を持つモデルに対しても有効に機能する「転移性」という性質があり、攻撃手法がブラックボックスであっても脅威となります。注意点として、これらはAIの知能が低いから起きるというよりは、ディープラーニングの多次元空間における高精度な最適化の仕組みそのものに起因する本質的な課題であるため、単に学習データを増やすだけでは根本的な解決にならない場合があります。