機械学習の忘却監査のための新しいフレームワーク
Google/DeepMind
Googleの研究者は、Regularized f-Divergence Kernel Tests(正則化f-divergenceカーネルテスト)を導入しました。これは、機械学習の忘却を監査する新しいフレームワークで、モデルが機密データを忘れたかどうかを統計的に頑健に検証できます。この手法は、大規模モデルに対する感度の低下や偽陽性などの従来のテストの問題に対処します。このフレームワークは、合成データ、高エネルギー物理学タスク、差分プライバシー監査、忘却評価で正常にテストされています。
Googleは、機械学習のアンラーニングを監査するための新しいフレームワーク「Regularized f-Divergence Kernel Tests」を発表した。機械学習のアンラーニングにより、AIシステムは完全な再トレーニングなしにトレーニングデータの特定の部分を「忘れる」ことが可能になり、規制遵守(例えば、一般データ保護規則、GDPRに基づく「忘れられる権利」)、AI安全性、モデルの品質にとって重要である。従来の検証方法は2標本検定であり、レコードを見たことがないモデルとそれを「忘れた」モデルの出力分布を比較する。しかし、モデルが大きくなるにつれて、この方法は統計的検出力を失い、膨大な数のサンプルを必要とするため、計算コストが高くなる。新しいフレームワークは、2026年第26回人工知能と統計に関する国際会議(AISTATS 2026)で発表され、fダイバージェンスに基づく正則化テストを使用し、最適なダイバージェンスとハイパーパラメータを自動的に選択するため、手動チューニングが不要となる。著者らは、このテストが任意のサンプルサイズに対して偽陽性を制御し、データが増えるにつれて偽陰性のリスクがゼロに近づくことを理論的に証明している。また、このフレームワークは、安全に再トレーニングされたモデルと元の侵害されたモデルとを比較する相対的3標本テストも提供し、完全な再トレーニング等価性を達成することの不可能性に対処している。合成データ、高エネルギー物理学データ(希少粒子の探索)、差分プライバシーの監査、忘却方法の評価に関する実験では、このフレームワークはベースライン法を上回るか同等の性能を示し、必要なサンプル数とチューニングが少なかった。例えば、プライバシー監査では、ホッケースティックダイバージェンステストがSVT3メカニズムの違反を数千サンプルで検出したのに対し、DP-Auditoriumは数百万サンプルを必要とした。忘却評価では、ランダムラベル法のみがテストに合格し、ファインチューニング、プルーニング、選択的シナプス減衰は効果がないことが判明した。著者らは、簡略化された実装を使用したことを強調しており、本番環境ではより厳密な設定が必要である。この研究はAntonín SchrabとArthur Grettonとの共同研究である。
出典: Google Research —
原文
