自进化智能体Ouroboros在主要基准测试中超越Codex和Claude Code
OpenAI
Anthropic
一位独立开发者创建了一个名为Ouroboros的自主智能体,它能够编写并改进自己的代码。该智能体在终端基准测试2.1、CL-Bench和OSWorld上取得了最先进的结果,并在GAIA和SWE-Pro上与Claude Code和Codex表现相当。
Ouroboros 代理的开发者描述了他们的目标:创造一个通用的类似 Jarvis 的代理,但很快意识到这太难了,于是他们转而赋予代理在自主进化循环中设计和构建自己的能力。Ouroboros 是一个基于 Python 的代理循环,可以访问 git,有权重写自己的运行时,在新版本中安全重启,并在出现问题时回滚。第一版被放置在 Google Colab 中以保安全,并给予预算和自主权。几个月后,这个最初只是绘制猫和更换壁纸的简单桌面代理,如今在 Terminal-Bench 2.1、CL-Bench 和 OSWorld 上达到了最先进的结果,并在 GAIA 和 SWE-Pro 上与 Claude Code 和 Codex 持平。开发者承认,他们自己无法设计出这样的框架,但自主进化和 token 支出使之成为可能。帖子包括基准测试数字、可复现性细节、来自 trace 审计的尴尬故事,以及架构的简要概述。
来源: Habr — хаб ИИ —
原文
