研究AI安全 🇺🇸 27.07.2026 11:06

审计机器遗忘的新框架

Google/DeepMindGoogle/DeepMind
谷歌研究人员引入了正则化f散度核检验,这是一种审计机器遗忘的新框架,能够对模型是否忘记机密数据进行统计稳健的验证。该方法解决了传统测试在大型模型上灵敏度下降和误报等问题。该框架已成功应用于合成数据、高能物理任务、差分隐私审计以及遗忘评估。
Google推出了一种名为正则化f散度核检验的新框架,旨在审计机器遗忘。机器遗忘使AI系统能够“忘记”训练数据的特定部分,而无需完全重新训练,这对于法规遵从(例如,通用数据保护条例GDPR下的“被遗忘权”)、AI安全和模型质量至关重要。传统的验证方法是双样本检验,它比较从未见过某条记录的模型和已经“遗忘”该记录的模型的输出分布。然而,随着模型规模的增长,这种方法在统计功效上减弱,并且需要大量的样本,导致计算成本高昂。新框架在2026年第26届人工智能与统计国际会议(AISTATS 2026)上提出,采用基于f散度的正则化检验,并自动选择最佳的散度和超参数,无需手动调整。作者从理论上证明,这些检验对于任意样本量都能控制假阳性,并且假阴性的风险随着数据量的增加而趋于零。该框架还提供了一种相对的三样本检验,将遗忘模型与安全重训练的模型以及原始的受影响模型进行比较,解决了无法实现完美重训练等价性的问题。在合成数据、高能物理数据(寻找稀有粒子)、差分隐私审计以及遗忘方法评估的实验中,该框架在需要更少样本和更少调整的情况下,表现优于或等同于基线方法。例如,在隐私审计中,使用数千个样本就能检测出SVT3机制中的违规行为,而DP-Auditorium则需要数百万个样本。在遗忘评估中,只有随机标签方法通过了检验,而微调、剪枝和选择性突触阻尼则被证明无效。作者强调,他们使用了简化的实现;生产环境需要更严格的设置。这项工作是与Antonín Schrab和Arthur Gretton合作完成的。
来源: Google Research — 原文
我们之前关于此话题的帖子 ↓
最新新闻