AIの学習において汚染されたデータを使った攻撃があると思いますが、推論モードでAIにそのデータが汚染されているか判定させてから学習データとして成型するようなことってしないの? |
|
|
できます。実際、学習データを別のAIモデルで事前に検査してから学習に投入するという考え方はあります。 ただし、「推論モードのAIに汚染判定させれば解決」というほど単純ではありません。ここが面白いところです。 そもそもデータ汚染攻撃とは例えば攻撃者が大量のWebページや文書を学習データに混ぜて、 という攻撃をします。 目的によって、
などがあります。 特に最後のようなバックドア型のデータ汚染が厄介です。 「AIにチェックさせる」はかなり自然な発想例えば、 という構成は考えられます。 さらに、 と複数モデルで検査することもできます。 実際のデータパイプラインでも、重複除去、品質評価、有害コンテンツ除去、異常検知などを自動化することはあります。 でも「AIが汚染されていると判定できる」とは限らない最大の問題がここです。 例えば攻撃者が、 という普通の文章を100万件に少しずつ混ぜたとします。 1件だけ見れば、
となります。 ところが、 となる可能性があります。 つまり、 個々のデータは正常でも、集合として見ると汚染されている ということが起こります。 これはAIによる検査でも難しいです。 さらに「汚染の定義」が難しい例えばWikipediaの文章を考えてみます。 ある人物について、 という3種類の文章があったとします。 どれが「汚染データ」でしょう? AIに、
と指示すると、今度はAI自身の判断によって正しい情報まで削除する可能性があります。 つまり、 という別の問題が発生します。 推論モデルを使えば強くなる?ここも重要です。 例えば普通の分類器ではなく、より高度な推論モデルに、
とやらせることはできます。 これは単純なルールベースのフィルタより強力になる可能性があります。 しかし、 推論能力が高いことと、真偽を確実に判定できることは別です。 AIが間違ったデータを「これは正しい」と判断すれば、そのデータは通過してしまいます。 さらに厄介なのが「検査AI自身への攻撃」攻撃者からすると、 という構造なら、 検査AIを騙すデータを作ればいい となります。 例えば、 という攻撃です。 これはセキュリティでいう敵対的な環境での分類問題に近いです。 だから実際には「AI一発判定」にしない強い設計にするなら、例えば、 のように複数の防御を組み合わせる方が現実的です。 さらに、
といった対策も重要です。 実は「推論モデルをデータクリーナーにする」はかなり面白い今後かなり重要になる方向性だと思います。 特に、 というAIをAIのデータ品質管理に使う構成は合理的です。 ただし、セキュリティ的には、
というゼロトラスト的な考え方が重要になります。 なので質問の発想はかなり筋がよくて、実際に考えられるアプローチです。ただ、最終的にはAIによる判定+統計的検査+データの出所管理+サンプリング監査のような多層防御にするのがポイントです。 |
|
|

この記事へのコメント