Nouveau cadre pour auditer le désapprentissage machine
Google/DeepMind
Les chercheurs de Google ont présenté les tests de noyau de divergence f régularisée (Regularized f-Divergence Kernel Tests), un nouveau cadre pour auditer le désapprentissage machine qui permet une vérification statistiquement robuste du fait qu'un modèle a oublié des données confidentielles. La méthode résout les problèmes des tests traditionnels, tels que la perte de sensibilité sur les grands modèles et les faux positifs. Le cadre a été testé avec succès sur des données synthétiques, des tâches de physique des hautes énergies, l'audit de confidentialité différentielle et l'évaluation du désapprentissage.
Google présente un nouveau framework appelé Regularized f-Divergence Kernel Tests, conçu pour auditer le désapprentissage automatique. Le désapprentissage automatique permet aux systèmes d'IA d'« oublier » des parties spécifiques des données d'entraînement sans réentraînement complet, ce qui est crucial pour la conformité réglementaire (par exemple, le « droit à l'oubli » en vertu du Règlement général sur la protection des données, RGPD), la sécurité de l'IA et la qualité des modèles. La méthode de vérification traditionnelle est le test de deux échantillons, qui compare les distributions de sortie d'un modèle qui n'a jamais vu un enregistrement et de celui qui l'a « oublié ». Cependant, à mesure que les modèles grandissent, cette méthode perd de la puissance statistique et nécessite un nombre énorme d'échantillons, ce qui la rend coûteuse en calcul. Le nouveau framework, présenté à la 26e Conférence internationale sur l'intelligence artificielle et les statistiques en 2026 (AISTATS 2026), utilise des tests régularisés basés sur les f-divergences et sélectionne automatiquement la meilleure divergence et les hyperparamètres, éliminant ainsi le besoin de réglage manuel. Les auteurs prouvent théoriquement que les tests contrôlent les faux positifs pour toute taille d'échantillon, et que le risque de faux négatifs tend vers zéro avec l'augmentation des données. Le framework propose également un test relatif de trois échantillons qui compare le modèle d'oubli avec un modèle réentraîné de manière sûre et le modèle compromis d'origine, répondant ainsi à l'impossibilité d'atteindre une équivalence parfaite de réentraînement. Dans des expériences sur des données synthétiques, des données de physique des hautes énergies (recherche de particules rares), l'audit de la confidentialité différentielle et l'évaluation des méthodes d'oubli, le framework a surpassé ou égalé les méthodes de référence tout en nécessitant moins d'échantillons et moins de réglages. Par exemple, dans l'audit de confidentialité, le test de divergence hockey-stick a détecté des violations dans le mécanisme SVT3 en utilisant plusieurs milliers d'échantillons, alors que DP-Auditorium en nécessitait des millions. Dans l'évaluation de l'oubli, seule la méthode d'étiquetage aléatoire a réussi le test, tandis que le fine-tuning, l'élagage et l'amortissement synaptique sélectif se sont avérés inefficaces. Les auteurs soulignent qu'ils ont utilisé des implémentations simplifiées ; des réglages plus rigoureux sont nécessaires pour les environnements de production. Ce travail a été réalisé conjointement avec Antonín Schrab et Arthur Gretton.
Source: Google Research —
original
