ИсследованияАгенты 🇺🇸 27.07.2026 09:05

ScarfBench: бенчмарк для оценки ИИ-агентов при миграции корпоративных Java-фреймворков

IBMIBM AnthropicAnthropic
Представлен ScarfBench — открытый бенчмарк для оценки ИИ-агентов на задачах миграции между фреймворками Spring, Jakarta EE и Quarkus. Тестирование показало, что даже лучшие агенты часто ошибаются, а самостоятельные отчёты агентов о завершении миграции ненадёжны. Главная сложность — не перевод кода, а управление зависимостями в конфигурации, инфраструктуре и среде выполнения.
ScarfBench (Self-Contained Application Refactoring Benchmark) — новый открытый бенчмарк для оценки ИИ-агентов на задачах миграции между корпоративными Java-фреймворками: Spring, Jakarta EE и Quarkus. В отличие от традиционных бенчмарков, сравнивающих сгенерированный код с эталоном, ScarfBench проверяет, собирается ли мигрированное приложение, развёртывается ли оно и сохраняет ли поведение.
Показать ещё ↓
Источник: Hugging Face blog — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости