или утверждения. Сначала он читает репозиторий, затем планирует, пишет, запускает и проверяет тесты. На внутреннем бенчмарке Microsoft из 152 задач он выполнил 140 задач (92,1%) против 120 (78,9%) у стандартного GitHub Copilot, используя ту же модель и подсказки, что означает на 63% меньше сбоев. Улучшения в основном заметны на нечетких подсказках (79/89 решено против 59/89) и задачах, нацеленных на diff (15/15 против 0/15). Он сгенерировал на 2,3% меньше тестов (6 963 против 7 129) при почти одинаковом покрытии строк (72,4% против 72,2%) и был в среднем на 5,5% быстрее по времени выполнения задачи. Агент координирует работу через конвейер «Исследование-План-Реализация», определяет язык и тестовый фреймворк, находит команды сборки и тестирования и никогда не изменяет производственный код. Перед сообщением о завершении он выполняет пять проверок, включая облегченный подход к мутационному тестированию. Агент — это определение с навыками, а не облачный сервис, поэтому он работает внутри существующих агентов для написания кода и оставляет код локальным.