Nuevo marco para auditar el desaprendizaje automático
Google/DeepMind
Investigadores de Google presentaron las Pruebas de Núcleo de Divergencia f Regularizada, un nuevo marco para auditar el desaprendizaje automático que permite una verificación estadísticamente robusta de si un modelo ha olvidado datos confidenciales. El método aborda problemas con pruebas tradicionales, como la pérdida de sensibilidad en modelos grandes y los falsos positivos. El marco se ha probado con éxito en datos sintéticos, tareas de física de altas energías, auditoría de privacidad diferencial y evaluación de desaprendizaje.
Google presenta un nuevo marco llamado Regularized f-Divergence Kernel Tests, diseñado para auditar el desaprendizaje automático. El desaprendizaje automático permite a los sistemas de IA "olvidar" partes específicas de los datos de entrenamiento sin necesidad de reentrenamiento completo, lo cual es crucial para el cumplimiento normativo (por ejemplo, el "derecho al olvido" bajo el Reglamento General de Protección de Datos, RGPD), la seguridad de la IA y la calidad del modelo. El método de verificación tradicional es la prueba de dos muestras, que compara las distribuciones de salida de un modelo que nunca vio un registro y otro que lo ha "olvidado". Sin embargo, a medida que los modelos crecen, este método pierde potencia estadística y requiere una gran cantidad de muestras, lo que lo hace computacionalmente costoso. El nuevo marco, presentado en la 26.ª Conferencia Internacional sobre Inteligencia Artificial y Estadística en 2026 (AISTATS 2026), utiliza pruebas regularizadas basadas en f-divergencias y selecciona automáticamente la mejor divergencia y los hiperparámetros, eliminando la necesidad de ajuste manual. Los autores demuestran teóricamente que las pruebas controlan los falsos positivos para cualquier tamaño de muestra, y el riesgo de falsos negativos tiende a cero con el aumento de datos. El marco también ofrece una prueba relativa de tres muestras que compara el modelo de olvido con uno reentrenado de manera segura y con el modelo original comprometido, abordando la imposibilidad de lograr una equivalencia perfecta con el reentrenamiento. En experimentos con datos sintéticos, datos de física de alta energía (búsqueda de partículas raras), auditoría de privacidad diferencial y evaluación de métodos de olvido, el marco superó o igualó a los métodos de referencia, requiriendo menos muestras y menos ajuste. Por ejemplo, en la auditoría de privacidad, la prueba de divergencia hockey-stick detectó violaciones en el mecanismo SVT3 usando varios miles de muestras, mientras que DP-Auditorium requería millones. En la evaluación del olvido, solo el método de etiquetas aleatorias pasó la prueba, mientras que el ajuste fino, la poda y el Debilitamiento Sináptico Selectivo resultaron ineficaces. Los autores enfatizan que utilizaron implementaciones simplificadas; se necesitan entornos más rigurosos para entornos de producción. Este trabajo se realizó conjuntamente con Antonín Schrab y Arthur Gretton.
Fuente: Google Research —
original
