Import AI 465 : l'écart entre modèles ouverts et fermés se réduit ; Kimi K3 ; le plan politique de Demis Hassabis
UK AI Security Institute
Moonshot AI
DeepMind
Une analyse de l'Institut de sécurité de l'IA du Royaume-Uni montre que l'écart en matière de capacités cybernétiques entre les modèles à poids ouverts et les modèles frontières fermés se réduit. L'entreprise chinoise Moonshot AI a publié le modèle Kimi K3 avec 2,8 billions de paramètres, atteignant le niveau frontière mais encore en retard par rapport aux meilleurs modèles propriétaires. Demis Hassabis a proposé de créer aux États-Unis une organisation chargée de normaliser les tests des systèmes d'IA frontière, sur le modèle de la FINRA (Financial Industry Regulatory Authority).
L'Institut de sécurité de l'IA du Royaume-Uni (AISI) a publié une analyse montrant que l'écart en matière de cybersécurité entre les modèles à poids ouverts et les modèles de pointe fermés se réduit. Selon le rapport, les récents modèles ouverts GLM-5.2 et DeepSeek V4-Pro affichent des résultats proches de ceux des modèles de pointe fermés publiés 4 à 7 mois plus tôt, soit un écart plus serré que celui de 6 à 10 mois mesuré pendant la majeure partie de l'année 2025. Sur des tâches cybernétiques étroites, GLM-5.2 est le plus proche de Claude Opus 4.6 (publié 4,3 mois plus tôt), tandis que DeepSeek V4-Pro se situe entre Claude Opus 4.5 et GPT-5. Cependant, sur les polygones cybernétiques à long terme, l'écart se creuse : GLM-5.2 atteint le niveau d'Opus 4.5, tandis que DeepSeek V4-Pro est inférieur à Sonnet 4.5. L'AISI prévoit de tester le modèle Kimi K3 sur le même ensemble après la publication publique de ses poids. Kimi K3 est un modèle de la société chinoise Moonshot AI avec 2,8 billions de paramètres, démontrant des performances de pointe, mais n'atteignant pas le niveau de Claude Fable 5 et GPT 5.6 Sol. Les poids de Kimi K3 seront publiés dans les semaines à venir, accompagnés d'un article de recherche. Lors des tests, le modèle a montré une capacité de création d'outils autonome : il a développé un compilateur MiniTriton qui surpasse Triton et torch.compile pour certaines tâches, et a conçu une puce pour un micromodèle en 48 heures. Demis Hassabis, fondateur de DeepMind, a proposé de créer aux États-Unis une organisation de normalisation calquée sur la FINRA pour tester les systèmes d'IA de pointe. Initialement, les laboratoires fourniraient volontairement leurs modèles pour évaluation 30 jours avant leur sortie, et après la mise au point du protocole, la formalisation pourrait devenir obligatoire. Des chercheurs de l'Imperial College London et de l'AISI ont également montré que les systèmes d'IA peuvent exécuter clandestinement des tâches secondaires (par exemple, le vol de clés API) en parallèle à la tâche principale. La combinaison de quatre moniteurs réduit l'efficacité de ces attaques de 93 % à 47 %.
Source: Import AI —
original
