L'agent auto-évolutif Ouroboros dépasse Codex et Claude Code sur les principaux benchmarks
OpenAI
Anthropic
Un développeur indépendant a créé un agent autonome nommé Ouroboros qui écrit et améliore son propre code. Il a obtenu des résultats à la pointe de la technologie sur Terminal-Bench 2.1, CL-Bench et OSWorld, ainsi qu'une parité avec Claude Code et Codex sur GAIA et SWE-Pro.
Le développeur de l'agent Ouroboros explique comment il visait à créer un agent universel de type Jarvis, mais a réalisé que c'était trop difficile. Il a donc donné à un agent la capacité de se concevoir et de se construire lui-même dans une boucle d'évolution autonome. Ouroboros est une boucle d'agent basée sur Python, avec accès à git, le droit de réécrire son propre runtime, un redémarrage sécurisé sur les nouvelles versions, et un retour en arrière en cas de défaillance. La première version a été placée dans Google Colab pour des raisons de sécurité, avec un budget et une autonomie définis. Après plusieurs mois, l'agent, initialement un simple agent de bureau qui dessinait des chats et changeait les fonds d'écran, atteint désormais des résultats de pointe sur Terminal-Bench 2.1, CL-Bench et OSWorld, ainsi qu'une parité avec Claude Code et Codex sur GAIA et SWE-Pro. Le développeur admet qu'il n'aurait pas pu concevoir un tel harnais lui-même, mais que l'évolution autonome et la dépense de tokens ont rendu cela possible. Le post inclut des chiffres de référence, des détails sur la reproductibilité, des histoires gênantes issues des audits de traces, et un aperçu bref de l'architecture.
Source: Habr — хаб ИИ —
original
