AIシステムを守るセキュリティ。敵対的攻撃・データ汚染攻撃の理解は必須。
AIにも『攻撃』があるって聞いた!
そうなのよ、敵対的攻撃(Adversarial Attack)とデータ汚染攻撃(Data Poisoning)が代表的ね。
敵対的攻撃は『推論時に微小な摂動を加えて誤分類させる攻撃』。 例えば、パンダの画像にノイズを加えるとAIには『テナガザル』に見えてしまう、といった具合。 人間にはほぼ気づかない違い。
怖いですぅ…
応用例として、『止まれ標識』に小さな模様を貼って自動運転車に制限速度標識と誤認させる、といった研究もある。 セキュリティ上の重大リスク。
データ汚染攻撃は?
こちらは『学習時に悪意のあるデータを混入させ、モデルの挙動を歪める攻撃』なのよ。 例えば、スパムフィルターに『正常メール』とラベル付けしたスパムを大量に混ぜ込んで、本物のスパムを通すように仕向ける、といった具合ね。
他にもモデル抽出攻撃(APIから問い合わせを繰り返してモデルを再現)、メンバーシップ推論攻撃(訓練データに特定サンプルが含まれていたか推定)などがある。
守る側はどう対策すればいいんですかぁ?
敵対的訓練(攻撃データを訓練に混ぜて頑健化)、入力検証、出力監視、差分プライバシー、モデルアクセス制限、訓練データの管理など、対策はいろいろあるのよ。 多層防御が基本ということね。
AIだから安全、ではないんだね。
むしろAIシステム特有のリスクが増えるくらい。 データサイエンティストにとってもセキュリティの基本知識は必須よ。
DS検定★ では『敵対的攻撃 vs データ汚染攻撃の違い』『推論時 vs 学習時』が頻出。
確認クイズ
AIシステムへの『データ汚染攻撃(Data Poisoning)』の特徴として正しいのはどれか。
- 推論時に入力に微小な摂動を加える
- 学習時に悪意のあるデータを混入させ、モデルの挙動を歪める
- APIから情報を盗み出す
- ハードウェア破壊を伴う
こたえを見る
正解: 2. 学習時に悪意のあるデータを混入させ、モデルの挙動を歪める
学習時に悪意のあるデータを混入させ、モデルの挙動を歪めるのがデータ汚染攻撃。 推論時の敵対的攻撃と区別するのが頻出問題。 学習データの来歴管理(データガバナンス)が対策の核です。