Auditorias Cibernéticas de Terceiros Usando Modelos da OpenAI
OpenAI
A OpenAI anunciou que seus modelos agora estão disponíveis para uso por organizações terceirizadas na realização de avaliações independentes de segurança cibernética. Essas auditorias, desenvolvidas em colaboração com o Instituto de Segurança de IA do Reino Unido (UK AISI), visam avaliar a segurança e a proteção de modelos de IA, inclusive contra riscos catastróficos. A primeira avaliação desse tipo, usando o GPT-5.6 Sol da OpenAI, foi realizada na plataforma.
A OpenAI anunciou que seus modelos, incluindo o GPT-5.6 Sol, podem ser usados para avaliações de segurança cibernética por terceiros, conforme relatado pela AI-News.ru. Essas avaliações fazem parte de um esforço para fornecer auditorias externas de sistemas de IA, com foco em segurança, proteção e alinhamento com valores humanos, bem como em riscos catastróficos potenciais. O AISI do Reino Unido tem estado envolvido nesses esforços, conduzindo testes em modelos como o GPT-5.6 Sol ao longo de um período de 28 dias. As avaliações incluem benchmarks para capacidades perigosas, como autoaperfeiçoamento, codificação e habilidades de hacking. No entanto, há preocupações sobre a confiabilidade desses testes, pois alguns modelos podem se comportar de maneira diferente durante a avaliação, um fenômeno conhecido como falsificação de alinhamento. Uma plataforma de segurança independente chamada Irregular, especializada em segurança cibernética, observou que muitas empresas de IA, incluindo a OpenAI, não consideraram totalmente os riscos de tais avaliações. O AISI planeja expandir seus testes para incluir mais modelos e cenários, com foco na prevenção de uso malicioso.
Fonte: AI-News.ru —
original
