Rails-Tests auf Autopilot: KI-Agent schreibt Tests statt Entwickler
Mistral
Mistral AI hat einen autonomen Agenten auf Basis des Open-Source-Tools Vibe entwickelt, der automatisch RSpec-Tests für Rails-Monolithen generiert und verbessert. Der Agent liest Quelldateien, erstellt oder verfeinert Tests, überprüft deren Stil mit RuboCop, führt sie mit RSpec und SimpleCov aus und behebt Fehler. In einem Experiment mit 275 Dateien wurde eine Abdeckung von 100 % erreicht, alle Tests bestanden, und die durchschnittliche LLM-als-Richter-Bewertung lag bei 0,74.
Mistral AI hat einen autonomen Agenten zum Testen von Rails-Anwendungen entwickelt, der auf ihrem quelloffenen Tool Vibe basiert. Der Agent liest die Rails-Quelldateien (Modelle, Serialisierer, Controller, Mailer, Helfer) und generiert oder verbessert RSpec-Tests, wobei er den Konventionen zur Dateizuordnung folgt. Für verschiedene Dateitypen werden separate Skills-Dateien verwendet. Der Agent führt RuboCop zur Stilprüfung sowie SimpleCov zusammen mit RSpec zur Überprüfung der Testabdeckung und Korrektheit aus – dies ist ein obligatorischer letzter Schritt, da Tests ohne Ausführung zwar qualitativ aussehen, aber aufgrund von Syntaxfehlern nicht funktionieren können. In AGENTS.md ist eine Schritt-für-Schritt-Anleitung beschrieben, die eine erzwungene Selbstüberprüfung umfasst: Der Agent liest die Quelldatei erneut und prüft, ob alle öffentlichen Methoden getestet sind. Beim ersten Durchlauf bestand nur ein Drittel der Tests, aber der Agent behob alle Fehler innerhalb weniger Iterationen. In einem Experiment mit 275 Dateien (die Hälfte ohne Tests) generierte oder verbesserte der Agent Tests, erreichte 100% bestandene Tests, null RuboCop-Verstöße, 100% SimpleCov-Abdeckung und eine durchschnittliche Bewertung von 0,74 nach der LLM-as-a-Judge-Methode. Die besten Ergebnisse erzielten Modelle (0,81), die schlechtesten Controller (0,67).
Quelle: Mistral AI —
Original
