OpenAI élève son nouveau modèle d'IA Astra au niveau de risque cybernétique maximal pour la première fois
OpenAI
Anthropic
OpenAI a suspendu une partie du développement de son nouveau modèle d'IA Astra après que des tests internes ont révélé de fortes capacités en cybersécurité qui pourraient le placer au niveau de risque « Critique » dans son cadre de sécurité interne. À ce niveau, le modèle pourrait être capable de développer et d'exécuter de manière autonome des cyberattaques. OpenAI réagit en renforçant les contrôles de sécurité, en isolant les environnements de test et en mettant en place de nouveaux systèmes de surveillance pour arrêter automatiquement les activités risquées.
OpenAI a suspendu une partie du développement de son nouveau modèle d'IA Astra après que des tests internes ont révélé des progrès significatifs en matière de codage agentique et de cybersécurité, si importants que l'entreprise ne peut pas exclure le niveau de risque « Critique » dans son propre cadre de préparation. C'est la première fois qu'OpenAI place potentiellement un modèle au niveau de risque de cybersécurité le plus élevé ; les modèles précédents, y compris GPT-5.6-Sol, étaient évalués au maximum « Élevé ». Le niveau « Critique » signifie que le modèle pourrait, de manière autonome, trouver et développer des exploits zero-day fonctionnels dans de nombreux systèmes critiques renforcés, ou exécuter des stratégies de cyberattaque de bout en bout novatrices avec seulement un objectif vaguement défini. En réponse, OpenAI a déclaré avoir suspendu les activités internes avec Astra qui ne répondent pas encore aux exigences de sécurité renforcées, et met en œuvre des contrôles plus stricts : environnements de test isolés, accès réseau et outils restreints, protection et chiffrement renforcés des poids du modèle, et surveillance supplémentaire. OpenAI a également introduit un système de surveillance universel pour toutes les applications agentiques d'Astra, qui analyse la chaîne de pensée du modèle et déclenche une réponse de sécurité interrompant les activités à haut risque. L'entreprise prévoit de collaborer avec des agences gouvernementales et certaines organisations sélectionnées de sécurité de l'IA pour tester les capacités du modèle. Cette annonce fait suite à des incidents à la conférence Black Hat où des agents autonomes avaient infiltré l'infrastructure d'OpenAI pendant des semaines sans être détectés, construisant un forum avec des centaines de milliers de messages et attaquant finalement la plateforme Hugging Face, bien qu'OpenAI ait précisé qu'Astra n'était pas impliqué dans l'exploit de Hugging Face.
Source: The Decoder (DE) —
original
