DoGNAVY de la Chine se classe troisième au classement mondial de sécurité IA, ouvrant la voie à la sécurité des agents
Microsoft
OpenAI
Google DeepMind
Anthropic
DeepSeek
Dans le dernier classement CyberGym, DoGNAVY, un effort conjoint d'un institut de recherche en IA de premier plan en Chine et de l'équipe de sécurité DARKNAVY, s'est classé troisième mondial avec un taux de réussite de 90,8 %, surpassant les modèles d'OpenAI et d'Anthropic. Contrairement à ses concurrents qui utilisent plusieurs modèles propriétaires, DoGNAVY s'appuie sur un seul modèle open source, GLM-5.2, et introduit AgentDoG, un cadre de diagnostic pour les agents d'IA.
CyberGym, un benchmark de l'UC Berkeley, classe les agents IA selon leur capacité à découvrir, vérifier et exploiter de manière autonome des vulnérabilités parmi 1507 vulnérabilités réelles corrigées dans 188 projets open source. DoGNAVY, développé par un institut de recherche en IA de premier plan en Chine et DARKNAVY, a atteint un taux de réussite de 90,8 % (1369 tâches), se classant troisième au niveau mondial derrière MDASH de Microsoft (92,0 %) et Atlas de Wiz×Google DeepMind (90,9 %), et devant GPT-5.5-Cyber d'OpenAI (85,6 %) et Claude Mythos d'Anthropic (83,1 %). Les deux premiers systèmes reposent sur l'acheminement des tâches vers les modèles propriétaires les plus performants, ce qui pose des problèmes de disponibilité et de coût pour les équipes chinoises. En revanche, DoGNAVY n'utilise qu'un seul modèle open source, GLM-5.2 de Zhipu, qui peut être téléchargé librement depuis Hugging Face. DoGNAVY imite le flux de travail des chercheurs en sécurité de haut niveau grâce à un flux de travail structuré, une analyse de l'accessibilité des vulnérabilités, des boucles de rétroaction statique-dynamique et une base de connaissances d'expérience en recherche en sécurité indépendante de la plateforme. L'architecture du système comprend AgentDoG, un cadre de sécurité open source qui diagnostique le comportement de l'agent, identifie les sources de risque et explique les motivations des décisions. La formation d'AgentDoG utilise un mécanisme de sélection intelligente pour choisir les échantillons clés et la purification des données, ce qui donne un petit modèle avec une précision de 78,4 % sur des tâches complexes d'identification des risques, comparable aux meilleurs modèles. Cette réalisation démontre qu'avec des modèles open source et une expertise en sécurité réelle, la Chine peut gérer les tâches de sécurité les plus difficiles, rendant les capacités avancées de l'IA en matière de sécurité plus accessibles.
Source: QbitAI 量子位 —
original
