Selbstentwickelnder Agent Ouroboros übertrifft Codex und Claude Code in wichtigen Benchmarks
OpenAI
Anthropic
Ein unabhängiger Entwickler hat einen autonomen Agenten namens Ouroboros geschaffen, der seinen eigenen Code schreibt und verbessert. Er erzielte Spitzenergebnisse bei Terminal-Bench 2.1, CL-Bench und OSWorld sowie Parität mit Claude Code und Codex bei GAIA und SWE-Pro.
Der Entwickler des Ouroboros-Agenten beschreibt, wie er versuchte, einen universellen Jarvis-ähnlichen Agenten zu erschaffen, aber feststellte, dass dies zu schwierig war. Stattdessen gab er einem Agenten die Fähigkeit, sich selbst in einer autonomen Evolutionsschleife zu entwerfen und zu bauen. Ouroboros ist eine in Python geschriebene Agentenschleife mit Zugriff auf Git, dem Recht, seine eigene Laufzeit umzuschreiben, sicheren Neustarts bei neuen Versionen und Rollback, falls etwas kaputtgeht. Die erste Version wurde aus Sicherheitsgründen in Google Colab platziert, mit einem Budget und Autonomie ausgestattet. Nach mehreren Monaten erzielt der Agent, der anfangs ein einfacher Desktop-Agent war, der Katzen zeichnete und Hintergrundbilder änderte, nun State-of-the-Art-Ergebnisse auf Terminal-Bench 2.1, CL-Bench und OSWorld sowie Parität mit Claude Code und Codex auf GAIA und SWE-Pro. Der Entwickler gibt zu, dass er ein solches Framework selbst nicht hätte entwerfen können, aber autonome Evolution und Token-Ausgaben haben es ermöglicht. Der Beitrag enthält Benchmark-Zahlen, Details zur Reproduzierbarkeit, peinliche Geschichten aus Trace-Audits und eine kurze Übersicht über die Architektur.
Quelle: Habr — хаб ИИ —
Original
