セキュリティ機械学習

ポイズニング攻撃

ぽいずにんぐこうげき · Poisoning Attack
1 views

ポイズニング攻撃とは、AIの学習データに悪意のある偽データやノイズを混入させ、モデルの予測精度を低下させたり特定の誤認識を引き起こさせたりする攻撃手法です。モデルの信頼性や安全性を損なう脅威であり、学習データの収集段階やファインチューニングの過程で防御策を講じることが重要視されています。

ポイズニング攻撃とは

ポイズニング攻撃とは、AIモデルの学習データに悪意のあるデータを混入させ、モデルを意図通りに誤作動させたり精度を低下させたりするサイバー攻撃手法です。

詳しく解説

ポイズニング攻撃は、機械学習モデルが入力されたデータを正として学習する特性を悪用します。攻撃者は訓練データセットに不正なデータやノイズを仕込みます。主な形態として、モデル全体の予測性能を落とす攻撃や、特定のトリガーに反応して意図した誤認識を起こすバックドア攻撃が存在します。自動で収集されたWebデータを使用する場合や、既存モデルに対するファインチューニングを実施する際に発生しやすく、AIの安全性を脅かす深刻な課題となっています。

具体例・使われ方

例えば、スパムメール検知AIの学習データにスパムメールを正常メールとラベル付けしたデータを混入させ、フィルタリング機能を無力化するケースがあります。また、画像認識AIの学習データに特定のマークを付けた標識画像を混入させ、本番環境でそのマークがある標識だけを意図的に誤認識させる事例が挙げられます。

似た用語との違い

運用時に攻撃対象のAIへ特殊な入力を与えて誤作動させる敵対的サンプル(回避攻撃)とは異なり、ポイズニング攻撃はモデルを構築する学習段階のデータそのものを汚染する点が大きな違いです。

注意点

ポイズニング攻撃は極小量のデータを改ざんするだけで成功する場合があり、事前に検知することが容易ではありません。また、モデルの精度低下が攻撃によるものか単なる学習不足かの見分けがつきにくいため、データソースの正当性確認や異常値フィルタリングが必須となります。

更新日時: 2026年8月31日 20:31