Forschung RSS

Agenten 🇺🇸

ScarfBench: Ein Benchmark zur Bewertung von KI-Agenten bei der Migration von Enterprise-Java-Frameworks

ScarfBench ist ein offener Benchmark zur Bewertung von KI-Agenten bei frameworkübergreifenden Migrationsaufgaben in Enterprise Java, der Spring, Jakarta EE und Quarkus abdeckt. Er testet, ob migrierte Anwendungen builden, deployen und ihr Verhalten beibehalten. Aktuelle Agenten zeigen übermäßiges Selbstvertrauen und kämpfen mit Umgebungsproblemen, wobei die Konfiguration den Migrationsaufwand dominiert.

IBMIBM AnthropicAnthropic
Hugging Face blog27.07 · 09:05
Anwendungen 🇷🇺

Test-Checkliste für Such- und RAG-Systeme: Sechs Ebenen von Prüfungen

Eine Checkliste zum Testen von Such- und RAG-Systemen (Retrieval-Augmented Generation) wird vorgestellt, die sechs Prüfebenen abdeckt – von der grundlegenden Funktionalität bis zur Handhabung unvollständiger Daten. Metriken, Werkzeuge und ein Glossar mit über 50 Begriffen werden beschrieben. Die Bedeutung der Ebenen-Reihenfolge wird betont: Es bringt nichts, RAG zu evaluieren, wenn die Nullstufe nicht bestanden wurde.

Habr — хаб NLP27.07 · 09:05
Aktuelle Nachrichten