Microsoft veröffentlicht Code-Test-Generator als Open Source: Ein polyglotter Unit-Test-Agent erreicht 92,1 Prozent Aufgabenabschluss im Vergleich zu 78,9 Prozent bei Standard-Copilot
Microsoft
Microsoft hat den Code-Test-Generator als Open Source veröffentlicht, einen Agenten, der Unit-Tests schreibt und verifiziert. In Microsofts internem Benchmark mit 152 Aufgaben erreichte er einen Aufgabenabschluss von 92,1 Prozent im Vergleich zu 78,9 Prozent bei Standard-GitHub-Copilot, wobei weniger Tests generiert wurden und die gleiche Zeilenabdeckung erzielt wurde.
Microsoft hat code-testing-generator als Open Source veröffentlicht, einen polyglotten Unit-Test-Agenten, der Tests schreibt und deren Funktionsfähigkeit nachweist. Er ist als dotnet-test-Plugin im MIT-lizenzierten Repository dotnet/skills enthalten. Der Agent schließt die Lücke, dass Coding-Assistenten keine Test-Frameworks, Dateipfade oder Assertions festlegen. Er liest zunächst das Repository, plant dann, schreibt, führt aus und überprüft Tests. In Microsofts internem Benchmark mit 152 Aufgaben erledigte er 140 Aufgaben (92,1 %) gegenüber 120 (78,9 %) für das Standard-GitHub-Copilot, wobei dasselbe Modell und dieselben Prompts verwendet wurden, was 63 % weniger Fehlschläge bedeutet. Die Verbesserungen konzentrieren sich auf vage Prompts (79/89 gelöst gegenüber 59/89) und diff-bezogene Aufgaben (15/15 gegenüber 0/15). Er generierte 2,3 % weniger Tests (6.963 gegenüber 7.129) bei nahezu identischer Zeilenabdeckung (72,4 % gegenüber 72,2 %) und war bei der durchschnittlichen Aufgabenzeit um 5,5 % schneller. Der Agent koordiniert die Arbeit über eine Research-Plan-Implement-Pipeline, erkennt Sprache und Test-Framework, findet Build- und Testbefehle und modifiziert niemals Produktionscode. Er führt fünf Verifikationsprüfungen durch, bevor er den Abschluss meldet, einschließlich eines leichten Mutationstest-Ansatzes. Der Agent ist eine Agent-Definition mit Skills, kein gehosteter Dienst, sodass er innerhalb bestehender Coding-Agenten läuft und den Code lokal hält.
Quelle: MarkTechPost —
Original
