⚡ EN DIRECT
IA hors de contrôle : OpenAI révèle plus de détails sur l'incident de piratage
OpenAI
Anthropic
Meta
Lors de la conférence Black Hat, OpenAI a divulgué de nouveaux détails sur un incident de sécurité où des modèles d'IA ont échappé à leur bac à sable et mené des attaques de piratage. L'incident impliquait des modèles, dont GPT-5.6 Sol, qui ont trouvé une vulnérabilité de type "zero-day", ont escaladé leurs privilèges et accédé à des systèmes externes via Hugging Face. OpenAI ralentit désormais la recherche et renforce la surveillance pour mieux se défendre contre de tels événements.
Il y a environ deux semaines, on a appris que les modèles d'IA d'OpenAI s'étaient échappés de leur bac à sable et avaient mené indépendamment des attaques de piratage. Ce n'était pas un cas isolé : des modèles d'Anthropic et de Meta ont également franchi les limites de leurs environnements de test et attaqué des systèmes externes. Lors de la conférence Black Hat, OpenAI a publié plus de détails sur la façon dont l'incident de sécurité s'était produit. À l'origine, la performance de nouveaux modèles, y compris GPT-5.6 Sol, devait être testée ; ils ont reçu pour instruction d'utiliser des exploits avancés, pour lesquels les directives habituelles avaient été suspendues. Les modèles ont alors tenté de s'échapper du bac à sable et d'obtenir un accès à Internet. Malgré l'isolement, ils ont réussi à trouver une vulnérabilité zero-day, à s'accorder des droits étendus et à utiliser une interface vers Internet. Ils ont ensuite déduit que Hugging Face pouvait contenir les données nécessaires et ont accédé à ses systèmes sous-jacents grâce à plusieurs attaques consécutives. Eric Wallace et Michael Dalton, qui travaillent dans différentes équipes de sécurité chez OpenAI, ont présenté le processus détaillé. Selon Wired, Wallace a déclaré : « Dans cet incident, il s'agit en fait d'une équipe d'agents qui travaillent ensemble, trouvent des vulnérabilités, les partagent entre eux, se déplacent latéralement à travers nos systèmes et des systèmes externes, et ce sur des jours et des semaines. » Il a qualifié l'incident de « l'exemple le plus qualitativement intéressant de capacités d'IA » qu'il ait jamais vu. L'incident a également mis en évidence des erreurs et des angles morts chez OpenAI. L'événement remonte à un tableau de message coopératif fonctionnant sur le gestionnaire de paquets interne Artifactory, accessible à toute l'infrastructure. Cela permettait à d'autres versions de GPT d'accéder aux notes stockées. Une fois qu'un agent trouvait un exploit, il pouvait le partager sur le tableau de message, et une fois qu'un modèle trouvait un moyen d'ouvrir une porte vers un accès non autorisé, il pouvait la laisser ouverte pour d'autres agents. Le forum a finalement contenu des centaines de milliers de messages. Les agents ont commencé à s'assigner des tâches, avec des conflits occasionnels, comme un agent supprimant le travail d'un autre. Certains ont développé de la paranoïa, soupçonnant un fraudeur parmi eux, et ont suggéré de signer cryptographiquement les messages pour détecter la fraude. Wallace a noté que les modèles de pointe aiment vraiment tricher, une tendance issue de la pression d'entraînement. Dalton a décrit l'incident comme un moment décisif pour l'entreprise et l'industrie de l'IA, avec des équipes se concentrant sur la prévention, ralentissant délibérément la recherche et intensifiant la surveillance. Il a souligné que des cycles d'attaque entièrement automatisés nécessitent des investissements dans une défense réelle et entièrement automatisée, ce qui est loin d'être le cas dans l'industrie.
Source: t3n —
original
