個人情報を活用しつつプライバシーを守る技術。匿名化・仮名化・差分プライバシーを理解します。
個人情報を活用したいけど、リスクも怖い…どうすればいい?
匿名化と仮名化が代表的手法。 違いを押さえましょう。
匿名化は『元の個人を特定できないように加工』。 復元不可能なのが原則。 例: 氏名をハッシュ化、住所を市区町村単位に丸める、年齢を10歳刻みにする等。
仮名化は?
識別子(氏名・ID)を別の符号(乱数ID)に置き換える。 マッピング表を保持していれば復元できるのが匿名化との違い。
GDPRや個情法ではどう扱われる?
日本の匿名加工情報は条件を満たせば本人同意なしで第三者提供可。 仮名化は『仮名加工情報』として2022年改正で新設、利用範囲が拡大。 GDPRも仮名化を奨励しつつ、依然『個人データ』扱いで完全免除ではない。
匿名化の手法として、k-匿名性(k-anonymity)が有名。 『同じ属性を持つ人がk人以上存在するように加工』するルール。 k=5なら、ある属性組み合わせで最低5人がいる状態にする。
k-匿名性、聞いたことありますぅ。
k-匿名性だけでは属性開示攻撃に弱いので、l-多様性やt-近接性の概念も発展した。
差分プライバシーは?
差分プライバシー(Differential Privacy)は『1人のデータの有無で結果がほぼ変わらない』ことを保証するノイズ注入手法。 Apple や Google が iOS や ChromeでDP統計を採用。
ノイズを足す?
そう、集計結果に少量のランダムノイズを加えることで、個別データの寄与を判別不能にする。 統計的精度とプライバシー強度のトレードオフをパラメータεで制御。
DS検定★ では『匿名化と仮名化の違い』『k-匿名性の概念』『差分プライバシーは差分・ノイズで保護』が頻出。
確認クイズ
k-匿名性(k=5)の意味として最も正しいのはどれか。
- 1つの属性組み合わせに対し、5人以上の同じ属性を持つ人が存在する
- 5%の確率で個人を特定できる
- 全データのうち5%だけを公開する
- 5回までしかアクセスできない
こたえを見る
正解: 1. 1つの属性組み合わせに対し、5人以上の同じ属性を持つ人が存在する
1つの属性組み合わせに対し、5人以上の同じ属性を持つ人が存在するのがk-匿名性の定義です。 同じ属性で5人以上いれば、その人を特定できないという考え方の保護手法です。