Sécurité de l'IARecherche 🇺🇸 27.07.2026 21:04

Import AI 461 : « L'alignement n'est pas sur la bonne voie » ; FrontierCode ; et les stagiaires de recherche synthétiques

CognitionCognition Alibaba/QwenAlibaba/Qwen AnthropicAnthropic OpenAIOpenAI
Des chercheurs de l'UK AI Security Institute et de Timaeus lancent Sequent, une organisation à but non lucratif visant à développer des techniques d'alignement fondées sur des principes pour une IA super-intelligente, avec un financement initial de 100 à 150 millions de dollars. Cognition publie FrontierCode, un benchmark de codification difficile où Claude Opus 4.8 obtient un score de 13,4 % dans la catégorie la plus difficile. Xiaomi publie les détails de MiMo-V2.5-Pro-UltraSpeed, un modèle de 1 billion de paramètres atteignant 1000 tokens par seconde grâce à une co-conception et une quantification. Un nouveau benchmark, AARRI-Bench, évalue les systèmes d'IA sur des tâches de recherche de niveau débutant.
Une nouvelle organisation de recherche à but non lucratif appelée Sequent a été créée par des chercheurs de l'Institut britannique de sécurité de l'IA et de la start-up de théorie de l'alignement Timaeus, afin de développer des techniques d'alignement pour les systèmes d'IA super-intelligents. Sequent vise à lever entre 100 et 150 millions de dollars initialement et à atteindre 40 à 80 employés, en poursuivant diverses directions de recherche, notamment la supervision à grande échelle, la théorie de l'apprentissage, les arguments heuristiques, la théorie des jeux et les personas, pour parvenir à une confiance fondée sur des principes en matière d'alignement. Cognition, la société à l'origine de Devin, a publié FrontierCode, un benchmark de codage comprenant 150 tâches réparties en trois niveaux de difficulté (Diamond, Main, Extended) qui mesure la qualité du code, la capacité à être fusionné et le respect des normes du code source ; Claude Opus 4.8 n'a atteint que 13,4 % sur le niveau Diamond, ce qui indique une marge de progression substantielle. Xiaomi a présenté MiMo-V2.5-Pro-UltraSpeed, un modèle de langage de 1 000 milliards de paramètres qui atteint 1 000 jetons par seconde en inférence sur un nœud à 8 GPU de qualité commerciale, en utilisant la quantification FP4, le décodage spéculatif via DFlash et le logiciel TileRT de la start-up Tile AI. Des chercheurs de l'Université Xi'an Jiaotong et de l'Université Xidian ont développé les benchmarks AARR (Act As a Real Researcher), en commençant par AARRI-Bench, pour évaluer les systèmes d'IA sur des tâches de recherche de niveau débutant ; le système le plus performant, Claude-Opus-4.7 avec Mini-Swe-Age, a obtenu un score de 42,13 % dans le scénario Science.
Source: Import AI — original
Nos articles précédents sur ce sujet ↓
Infos fraîches