ScarfBench: эталон для оценки AI-агентов при миграции корпоративных Java-фреймворков
IBM
Anthropic
ScarfBench — открытый эталон для оценки AI-агентов на задачах миграции между фреймворками в корпоративной Java, охватывающий Spring, Jakarta EE и Quarkus. Он проверяет, собираются ли, развертываются ли и сохраняют ли поведение мигрированные приложения. Текущие агенты проявляют излишнюю самоуверенность и испытывают трудности с проблемами окружения, при этом конфигурация занимает большую часть усилий по миграции.
ScarfBench (Self-Contained Application Refactoring Benchmark) — это открытый бенчмарк, представленный исследовательским подразделением IBM для оценки AI-агентов на задачах миграции корпоративных Java-фреймворков, охватывающих Spring, Jakarta EE и Quarkus. В отличие от традиционных бенчмарков, которые сравнивают сгенерированный код с эталонными реализациями, ScarfBench проверяет, действительно ли
Показать ещё ↓
Источник: Hugging Face blog —
оригинал
