Stripe запускает бенчмарк: ИИ-агенты умеют создавать интеграции, но слабы в верификации
Anthropic
OpenAI
Stripe выпустил набор тестов для оценки способности ИИ-агентов полностью разрабатывать интеграции с Stripe, включая бэкенд, фронтенд и браузерные платежи. Результаты показали, что агенты успешно генерируют код, но часто ошибаются на этапе проверки правильности работы в реальных условиях.
Stripe выпустил набор тестов для оценки способности ИИ-агентов полностью разрабатывать интеграции с Stripe, включая бэкенд, фронтенд и браузерные платежи. Бенчмарк построен вокруг 11 воспроизводимых сред, имитирующих реальные интеграционные проекты, такие как миграция Checkout и моделирование Billing API. Агенты работают через инструментарий на базе Goose и Model Context Protocol (MCP), включающий доступ к терминалу, автоматизацию браузера и поиск документации. Результаты показали, что агенты успешно генерируют код, но часто ошибаются на этапе проверки правильности работы в реальных условиях. Инженер Stripe Carol L. отметила, что ключевое узкое место — верификация, а не генерация кода. Выявлены два частых типа сбоев: в сценариях обновления SDK агенты ошибочно принимают HTTP-ошибку 400 за успех, а в браузерных платежах взаимодействие инструментов разрушает состояние страницы, и агенты не могут восстановить фокус. Stripe опубликовал бенчмарк как часть своего ИИ-набора инструментов и планирует улучшить обработку нечётких сигналов проверки, стабильность браузерного состояния и точность сквозной интеграции.
- Сокращения
- API = Application Programming Interface — интерфейс программирования приложений
- SDK = Software Development Kit — комплект разработки программного обеспечения
- MCP = Model Context Protocol — протокол контекста модели
- HTTP = Hypertext Transfer Protocol — протокол передачи гипертекста
Источник: InfoQ 中国 —
оригинал
