AIセキュリティデータ前処理機械学習

データポイズニング

でーたぽいずにんぐ · Data Poisoning
1 views

データポイズニングとは、機械学習モデルの訓練データに意図的に不正なデータを混入させ、誤動作や特定の脆弱性を引き起こす攻撃手法です。AIシステムの信頼性を脅かす重要なセキュリティリスクとして、LLMや画像認識などの幅広い分野で警戒されています。

データポイズニングとは

データポイズニングとは、AIモデルの学習段階で使われるデータセットに悪意ある改ざんデータを紛れ込ませ、モデルの予測精度を低下させたり、特定の出力を強制したりするサイバー攻撃の一種です。

詳しく解説

機械学習モデルは大量のデータを学習して構築されますが、そのデータ収集プロセスや公開されたデータセットが外部の攻撃者に汚染されると、モデルの振る舞いが意図せず変えられてしまいます。例えば、特定の画像を悪意あるラベルと結びつけて学習させることで、モデルに特定のトリガーワードや画像を入力した際だけ意図通りの誤作動を起こさせることができます。AIやディープラーニングの普及に伴い、インターネット上の膨大なデータを自動収集してモデルを作る機会が増えているため、この問題の重要性が急速に高まっています。

具体例・使われ方

例えば、自動運転向けの画像認識AIにおいて、道路標識のデータにわずかなノイズや不正な書き込みが混入された結果、特定の標識を別のものと誤認識するように仕向けるケースが挙げられます。また、スパムメールフィルターの学習データに正常なメールをスパムとして偽装登録し、フィルター機能を麻痺させる攻撃もこれに該当します。

似た用語との違い

モデルの運用開始後にデータを不正操作して誤認を誘発する「敵対的攻撃(アドバーサリアル・アタック)」と混同されやすいですが、データポイズニングは主にモデルの「学習・訓練段階」を標的とする点で異なります。

注意点

データポイズニングの厄介な点は、外見からは通常のデータと見分けがつきにくい点にあります。完全に防ぐことは難しいため、学習データの厳格な検証や信頼できるデータソースの選定、モデルの異常検知といった多層的なセキュリティ対策が不可欠です。

更新日時: 2026年9月1日 23:11