RechercheAgents 🇩🇪 14.08.2026 19:10

Une étude contredit Anthropic et OpenAI : la recherche IA autonome est encore loin

AnthropicAnthropic OpenAIOpenAI Sakana AISakana AI Google DeepMindGoogle DeepMind
Une nouvelle étude avec la participation de Princeton et de l'Institut de sécurité de l'IA du Royaume-Uni constate que les modèles d'IA de pointe actuels échouent dans la recherche IA indépendante, malgré les affirmations de grands laboratoires comme Anthropic et OpenAI. Utilisant une méthode d'« évaluation fantôme » avec des articles NeurIPS non publiés, les auteurs humains ont rejeté tout le travail généré par l'IA. Les agents ont eu du mal avec le jugement scientifique, la résolution créative de problèmes et la gestion des ressources.
Des chercheurs de Princeton et de l'Institut de sécurité de l'IA du Royaume-Uni ont mené une étude pour tester empiriquement si les agents d'IA peuvent mener des recherches indépendantes en IA. Ils ont utilisé une méthode appelée « évaluation fantôme », où les agents d'IA recevaient la question de recherche centrale d'articles non publiés, et les auteurs humains d'origine évaluaient les résultats comme des examinateurs de conférence. Les agents ont utilisé Claude Opus 4.8 avec un raisonnement supplémentaire, ont fonctionné pendant six jours avec un budget d'API de 3 000 dollars, un accès GPU et un accès au Web, dans le cadre de l'agent OpenClaw. Les auteurs originaux ont rejeté les deux articles générés par l'IA, l'un avec « rejet fort », citant des données mal motivées, une prose illisible et un manque de contributions nouvelles. L'analyse a identifié cinq faiblesses systématiques : manque de jugement pour la qualité publiable de la recherche, échec de la résolution créative de problèmes (les agents ont réduit leurs affirmations au lieu de générer de nouvelles hypothèses), retour en arrière inefficace (abandon prématuré d'objectifs ambitieux), manque de conscience des ressources (les agents ont utilisé moins de la moitié de leur budget) et dérive des instructions (oubli des instructions explicites, dépassement des limites de longueur). En revanche, les agents ont géré avec succès tout le travail d'ingénierie, y compris la recherche documentaire, le débogage de code GPU, l'exécution de centaines d'expériences et la compilation de documents LaTeX. Aucun piratage de récompense significatif n'a été trouvé. Pour vérifier leurs résultats, ils ont répété une expérience avec GPT-5.6 Sol et l'échafaudage Codex d'OpenAI, trouvant des modes d'échec presque identiques. L'étude contredit les affirmations d'Anthropic (qui a publié « When AI Builds Itself ») et d'OpenAI (qui a déclaré que GPT-5.6 Sol avait économisé des semaines en post-entraînement). Les auteurs notent que la fiche technique du système ne mentionne pas cette contribution. Ils concluent que les modèles de pointe peuvent gérer l'ingénierie mais ont du mal avec des questions de recherche ouvertes de plusieurs semaines. L'étude critique également le processus d'examen par les pairs, citant l'article AI Scientist-v2 de Sakana AI qui a été accepté lors d'un atelier mais retiré plus tard en raison d'erreurs de citation.
Source: The Decoder (DE) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches