GPT-Red:OpenAI 的自动化红队测试助力 AI 安全自我改进
OpenAI
OpenAI 推出了 GPT-Red,一个自动化红队测试系统,采用自博弈方法提升大型语言模型的安全性、对齐性以及抵御提示注入的鲁棒性。该系统使模型能够自主生成攻击场景并基于这些场景进行微调,从而在无需持续人工干预的情况下增强其鲁棒性。
OpenAI 发布了 GPT-Red,这是一个自动化红队测试系统,旨在提升人工智能的安全性、对齐性和鲁棒性。该系统采用自我对弈的学习方法,模型自主生成攻击提示和恶意场景,然后通过在这些场景上进行微调来改进自身防御。这种方法无需持续引入人类测试人员即可持续增强模型的鲁棒性。GPT-Red 在检测和缓解提示注入(一种攻击者试图通过精心设计的查询绕过模型限制的攻击)方面特别有效。该系统会自动评估攻击结果,并利用这些结果调整模型行为,从而使安全改进过程更具可扩展性和效率。
来源: OpenAI —
原文
