モデル抽出攻撃とは、攻撃者が学習済みAIモデルに対して多数の入力データを送信し、その出力結果(予測値や確率分布)を分析することで、オリジナルのモデルとほぼ同等の機能を持つ複製モデルを不正に再現・抽出するセキュリティ上の脅威です。モデルの知的財産保護や機密情報の流出対策において重要な問題となっています。
モデル抽出攻撃とは
一言でいうと、ブラックボックス状態のAIモデルに対して何度も入出力を繰り返すことで、その内部アルゴリズムや性能を模倣した複製モデルを不正に作成する攻撃手法です。
詳しく解説
モデル抽出攻撃は、機械学習モデルがAPIなどを通じて外部に公開されている場合によく発生します。攻撃者は内部のパラメータや学習データに直接アクセスできない状態(ブラックボックス)でも、APIに様々なクエリ(入力)を送り、得られた応答(出力)をペアにして独自の訓練データセットを作成します。このデータセットを用いて自前のモデルを学習(モデル蒸留と同様の原理)させることで、ターゲットモデルと同等の精度を持つ代替モデルを構築できます。この攻撃により、開発企業の知的財産が侵害されるだけでなく、抽出したモデルを利用して敵対的サンプル(アドバーサリアル攻撃)を効率的に生成されたり、メンバーシップ推論攻撃へと悪用されたりする危険性があります。
具体例・使われ方
例えば、有料で予測結果を提供する画像認識APIに対し、攻撃者が大量の画像データを送信してその分類結果を収集し、同等の性能を持つ画像認識モデルを無料で自作・公開する事例が挙げられます。また、翻訳AIサービスの入出力を大量に取得して競合サービスを無断で作成する行為もこの攻撃のイメージに当てはまります。
似た用語との違い
モデル反転攻撃やメンバーシップ推論攻撃との違いとして、モデル抽出攻撃は「モデルそのものの機能や構造(パラメータ)」を複製することを目的としています。これに対し、モデル反転攻撃やメンバーシップ推論攻撃は、モデルの学習に使用された「元の訓練データや個人のプライバシー情報」を復元・特定することを目的としています。
注意点
クエリの送信回数を制限したり、出力する確率値を丸めたりすることで攻撃を難しくできますが、完全に防御することは困難です。また、正規のユーザーによる頻繁なAPI利用との区別が難しいため、過度な防御措置が利便性を損なうリスクがあります。さらに、学術的なモデル蒸留技術と原理が共通しているため、技術自体の悪用を防ぐ運用上のルール形成が重要です。