AIの学習において汚染されたデータを使った攻撃があると思いますが
質問
AIの学習において汚染されたデータを使った攻撃があると思いますが、推論モードでAIにそのデータが汚染されているか判定させてから学習データとして成型するようなことってしないの?
無料! 3大AIはどれを選ぶ? ChatGPT・Gemini・Copilot 超便利!使い方ガイド (メディアックスMOOK)価格:1430円(2026/8/14 20:18時点)感想(1件)企業競争力を高めるための生成AIの教科書 Generative AI × INNOVATION [ 小島舞子 ]価格:2200円(2026/8/14 20:18時点)感想(2件)
解答できます。実際、学習データを別のAIモデルで事前に検査してから学習に投入するという考え方はあります。ただし、「推論モードのAIに汚染判定させれば解決」というほど単純ではありません。ここが面白いところです。そもそもデータ汚染攻撃とは例えば攻撃者が大量のWebページや文書を学習データに混ぜて、通常のデータ+攻撃者が作ったデータ↓学習↓モデルの挙動を変えるという攻撃をします。目的によって、モデル全体の性能を低下させる特定の対象について誤った知識を覚えさせる特定のトリガーを与えたときだけ異常動作させるなどがあります。特に最後のようなバックドア型のデータ汚染が厄介です。「AIにチェックさせる」はかなり自然な発想例えば、Webデータ ↓クリーニングAI ↓「怪しい」「問題なさそう」 ↓学習データという構成は考えられます。さらに、データA…





