АгентыИсследования 🇺🇸 27.07.2026 09:05

ScarfBench: эталон для оценки AI-агентов при миграции корпоративных Java-фреймворков

IBMIBM AnthropicAnthropic
ScarfBench — открытый эталон для оценки AI-агентов на задачах миграции между фреймворками в корпоративной Java, охватывающий Spring, Jakarta EE и Quarkus. Он проверяет, собираются ли, развертываются ли и сохраняют ли поведение мигрированные приложения. Текущие агенты проявляют излишнюю самоуверенность и испытывают трудности с проблемами окружения, при этом конфигурация занимает большую часть усилий по миграции.
ScarfBench (Self-Contained Application Refactoring Benchmark) — это открытый бенчмарк, представленный исследовательским подразделением IBM для оценки AI-агентов на задачах миграции корпоративных Java-фреймворков, охватывающих Spring, Jakarta EE и Quarkus. В отличие от традиционных бенчмарков, которые сравнивают сгенерированный код с эталонными реализациями, ScarfBench проверяет, действительно ли
Показать ещё ↓
Источник: Hugging Face blog — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости