AgentsRecherche 🇷🇺 05.08.2026 09:02

L'ère de l'auto-recherche : je me suis endormi et 40 hypothèses ont été testées pendant la nuit — que dois-je faire et comment travailler désormais ?

Google/DeepMindGoogle/DeepMind OpenAIOpenAI DeepMindDeepMind AnthropicAnthropic
Un ingénieur décrit comment il a automatisé le test d'hypothèses avec un agent IA, et en une nuit, celui-ci a testé 40 hypothèses. Il explique le passage de la recherche de solutions à la construction de systèmes qui trouvent des solutions, et discute d'exemples issus de Sankalp, Karpathy et DeepMind. Il aborde également les pièges tels que la parité de perte et la conception d'oracles, ainsi que l'importance du choix du modèle.
Un ingénieur raconte comment, au lieu de tester manuellement des hypothèses, il a écrit une description textuelle du pipeline de génération d'hypothèses, a demandé à Gemini de juger chaque tentative, et a laissé un agent tourner toute la nuit. Au matin, le journal montrait que 40 hypothèses avaient été testées. Il oppose ses premières tentatives naïves (lancer dix agents en parallèle sans plan) et sa deuxième tentative (donner aux agents un ordre du jour détaillé) à l'approche paresseuse du soir qui a fonctionné. Il explique que la clé n'était pas un meilleur contrôle des agents mais qui évalue le résultat. Il cite des précédents : la décomposition QR de sankalp atteint un gain de vitesse de 232x sur le QR par lots, le script de recherche automatique de Karpathy de 630 lignes a exécuté des centaines d'expériences pendant la nuit, et AlphaEvolve de DeepMind a amélioré les solutions pour 20 % des 50 problèmes mathématiques ouverts et a accéléré les centres de données, la conception de puces et la formation de l'IA de Google. Il partage deux cas personnels : dans le premier, il a passé deux semaines à élaborer manuellement des filtres pour des ensembles de données, mais un oracle basé sur Gemini avec un VLM a surpassé cela en quelques exécutions ; dans le second, il a obtenu une accélération de l'entraînement de 30 % mais a rencontré des pièges : il a oublié d'inclure une vérification de parité de la perte (conduisant à une perte NaN), et un oracle insuffisamment détaillé a manqué des artefacts comme des lettres restantes lors du retrait image-texte. Il souligne que la construction d'un bon oracle et d'une bonne boucle est le vrai travail, et que le modèle à l'intérieur de la boucle est important. Il conclut que l'expertise se déplace de « trouver une solution » à « construire un système qui trouve des solutions ».
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches