敵対的攻撃とは、AIや機械学習モデル(特に深層学習)に対して、人間には判別できないほどの微小なノイズや細工を加えた入力(敵対的サンプル)を与えることで、モデルに意図的な誤認識や誤分類を起こさせるサイバー攻撃の手法です。AIの脆弱性を突くセキュリティ上の重大な脅威として、現在盛んに研究されています。
敵対的攻撃とは
敵対的攻撃(アドバーサリアルアタック)とは、AI(人工知能)の入力データ(画像や音声、テキストなど)に、人間には気付かない程度のわずかなノイズや改変を加えることで、AIモデルを意図的に誤動作させる攻撃手法のことです。
詳しく解説
敵対的攻撃の仕組みは、機械学習モデルの決定境界(判断の境界線)付近の脆弱性を突くことにあります。例えば、パンダの画像に人間の目には見えない特定のノイズを加えることで、AIに「テナガザル」と高い自信度で誤判定させることが可能です。この攻撃は主に、モデルの内部情報(パラメータや勾配)が既知である「ホワイトボックス攻撃」と、モデルの入力と出力のみが既知である「ブラックボックス攻撃」に分類されます。深層学習の進歩に伴い、自動運転の道路標識の誤認や、顔認証システムの突破といったセキュリティリスクが顕在化しており、AIの安全性(堅牢性)を担保するための「敵対的防御」技術の確立が急務となっています。
具体例・使われ方
具体的な例として、自動運転車のカメラが認識する「一時停止(STOP)」の標識に特定のステッカーやノイズを貼ることで、AIに「速度制限」と誤認識させる攻撃があります。また、音声認識アシスタントに、人間には雑音にしか聞こえない音声を聴かせて、特定のコマンド(「鍵を開けて」など)を実行させる攻撃や、顔認証システムを欺くために特殊なパターンの眼鏡を着用する事例などが挙げられます。
似た用語との違い
敵対的攻撃と混同されやすい概念に「ポイズニング攻撃」があります。ポイズニング攻撃は、AIの「訓練(学習)フェーズ」で悪意あるデータを混入させてモデルの学習自体を歪める手法であるのに対し、敵対的攻撃(回避攻撃とも呼ばれる)は、すでに構築された「推論フェーズ」のAIモデルに対して、誤認識を誘発するデータを入力する手法という違いがあります。
注意点
敵対的攻撃への対策(敵対的訓練など)は進められていますが、完全な防御手法はまだ確立されていません。また、ノイズを加えることだけが攻撃ではなく、物理的なパターンの変化など、現実世界での単純な変更でもAIが誤動作する可能性があるため、システム全体のセキュリティ設計が重要です。AIモデルの精度が100%であっても、敵対的攻撃に対して頑健(ロバスト)であるとは限らない点に注意が必要です。