Testando Rails no piloto automático: um agente de IA que escreve testes em vez de desenvolvedores
Mistral
A Mistral AI construiu um agente autônomo sobre seu assistente de codificação de código aberto Vibe, que lê arquivos fonte Rails, gera ou melhora testes RSpec e executa em um pipeline de CI/CD sem intervenção humana. O agente alcançou 100% de taxa de aprovação nos testes e cobertura de código em uma base de código real de 275 arquivos, com uma pontuação de qualidade LLM-como-juiz de 0,74, acima de 0,49 em arquivos que já tinham testes.
A Mistral AI desenvolveu um agente autônomo que gera e melhora testes RSpec para aplicações Ruby on Rails. O agente é executado sobre o Vibe, o assistente de código aberto da Mistral, e opera em cinco tipos principais de arquivos: models, serializers, controllers, mailers e helpers. As principais técnicas incluem engenharia de contexto por meio de um arquivo AGENTS.md que fornece um plano de execução passo a passo e uma etapa forçada de auto-revisão, arquivos SKILLS especializados para cada tipo de arquivo e ferramentas personalizadas para lintagem (RuboCop) e verificação de cobertura (SimpleCov). O agente foi projetado para ser executado em paralelo, processando vários arquivos simultaneamente. Em um experimento em um repositório com 275 arquivos-fonte (metade sem testes), o agente alcançou 100% de taxa de aprovação nos testes e 100% de cobertura de linhas, com zero violações do RuboCop. A pontuação agregada do LLM-como-juiz para arquivos que já tinham testes melhorou de 0,49 para 0,74. Models obtiveram a pontuação mais alta (0,81) e controllers a mais baixa (0,67). A decisão mais impactante foi agrupar o SimpleCov com a execução do RSpec como etapa final, forçando o agente a executar todos os testes que escreveu; inicialmente, apenas um terço dos testes passou na primeira execução, mas o agente corrigiu todas as falhas.
Fonte: Mistral AI —
original
