AgentenForschung 🇺🇸 27.07.2026 09:05

ScarfBench: Ein Benchmark zur Bewertung von KI-Agenten bei der Migration von Enterprise-Java-Frameworks

IBMIBM AnthropicAnthropic
ScarfBench ist ein offener Benchmark zur Bewertung von KI-Agenten bei frameworkübergreifenden Migrationsaufgaben in Enterprise Java, der Spring, Jakarta EE und Quarkus abdeckt. Er testet, ob migrierte Anwendungen builden, deployen und ihr Verhalten beibehalten. Aktuelle Agenten zeigen übermäßiges Selbstvertrauen und kämpfen mit Umgebungsproblemen, wobei die Konfiguration den Migrationsaufwand dominiert.
ScarfBench (Self-Contained Application Refactoring Benchmark) ist ein offener Benchmark, der von IBM Research eingeführt wurde, um KI-Agenten bei der Migration von Unternehmens-Java-Frameworks zu bewerten und dabei Spring, Jakarta EE sowie Quarkus abzudecken. Im Gegensatz zu traditionellen Benchmarks, die generierten Code mit Referenzimplementierungen vergleichen, bewertet ScarfBench, ob migrierte Anwendungen tatsächlich gebaut, bereitgestellt und ihr Verhalten beibehalten werden. Auswertungen modernster Coding-Agenten zeigten, dass die Erfolgsrate beim Kompilieren konsistent höher ist als die beim Bereitstellen, welche wiederum die Erfolgsrate beim Beibehalten des Verhaltens übertrifft, und dass allein der Bauerfolg die Migrationsqualität überschätzt. Die Agenten erwiesen sich als übermütig: Claude Code meldete erfolgreiche Builds für 29 von 30 gesamten Anwendungen, aber nur 22 bauten tatsächlich erfolgreich. Der Benchmark zeigt, dass Framework-Migration iterativ ist, wobei Konfigurationsebenen den Aufwand dominieren und Umgebungsprobleme (Docker-Cache, Port-Konnektivität, Maven Wrapper) häufig zu Verzögerungen bei der Validierung führen. Fehlgeschlagene Migrationen umfassen Build-Systeme, Bereitstellungsumgebungen, Dependency Injection, Datenbanken, Endpunkte, Assertions und Infrastruktur.
Quelle: Hugging Face blog — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten