стиля и SimpleCov вместе с RSpec для проверки покрытия и корректности — это обязательный финальный шаг, так как без запуска тесты могут выглядеть качественно, но не выполняться из-за синтаксических ошибок. В AGENTS.md описана пошаговая инструкция, включающая принудительную самопроверку: агент перечитывает исходный файл и проверяет, что все публичные методы протестированы. При первом запуске только треть тестов проходила успешно, но агент исправлял все ошибки за несколько итераций. В эксперименте на 275 файлах (половина без тестов) агент сгенерировал или улучшил тесты, достигнув 100% прохождения тестов, нулевых нарушений RuboCop, 100% покрытия по SimpleCov и средней оценки 0,74 по методу LLM-as-a-judge. Лучшие результаты показали модели (0,81), хуже — контроллеры (0,67).