本文へスキップ

差分プライバシーとは?

さぶんぷらいばしー

差分プライバシーとは、個人のデータ統計解析に使いながらも、特定の個人の情報が漏れないことを数学的に保証するプライバシー保護の技術的枠組みのことです。

差分プライバシー(Differential Privacy)は、2006年にシンシア・ドワーク(Cynthia Dwork)らが提唱した、データのプライバシーを数学的に保証する理論的枠組みです。あるデータセットに1人のデータを加えても除いても、その出力結果がほとんど変わらないようにすることで、個人の参加・不参加が推測できないようにするというアイデアが核心にあります。

差分プライバシーを実現するための代表的な手法は「ノイズの付加」です。統計量や機械学習モデルのパラメータに対して、ランダムなノイズ(ラプラスノイズやガウスノイズなど)を意図的に加えることで、元のデータの細部を隠しながら全体的な傾向は保持します。プライバシー保護の強さはパラメータ「ε(イプシロン)」で表され、ε が小さいほど保護が強く、ε が大きいほどデータの有用性が増します。

主な応用場面としては以下があります。

  • AppleやGoogleが端末上のユーザー行動データを収集・分析する際に採用
  • 米国国勢調査局による国勢調査データの公開
  • 医療データを複数機関で共有する際の匿名化
  • 連合学習(Federated Learning)との組み合わせ

差分プライバシーはデータの有用性とプライバシーのトレードオフを定量的に管理できる点で、GDPRや個人情報保護法の要件を満たしながらデータ活用を行う現代のAI・データサイエンス領域において不可欠な技術として注目されています。

使い方・例文

スマートフォンが入力履歴を端末上で集計してサーバーに送る際、差分プライバシーを使って個人が特定されないようにしながらも全体的な傾向を把握することができます。機械学習モデルの学習データ保護の文脈でも頻繁に登場します。

この用語をシェア

𝕏 でポスト LINE

最終更新:

関連用語