Pesquisa 🇺🇸 28.07.2026 17:04

Por que meu modelo não funciona?

O artigo discute armadilhas comuns em aprendizado de máquina que fazem com que modelos falhem em aplicações do mundo real, apesar de parecerem bons durante os testes. Os principais problemas incluem dados enganosos (variáveis ocultas, correlações espúrias, erros de rotulagem), vazamento de dados (pré-processamento antes da divisão, viés de olhar para frente, sobreajuste iterativo do conjunto de teste) e escolha inadequada de métricas (por exemplo, acurácia em dados desbalanceados). O autor recomenda a lista de verificação REFORMS e práticas como uso de mapas de saliência, benchmarks diversos e divisões adequadas de dados para melhorar a confiabilidade do modelo.
O artigo, baseado em 20 anos de experiência do autor em aprendizado de máquina (machine learning, ML) e no artigo 'How to avoid machine learning pitfalls: a guide for academic researchers', descreve erros comuns que levam modelos a falhar em produção. Primeiro, dados enganosos: variáveis ocultas (exemplo: orientação do corpo em tomografias de Covid) e correlações espúrias (exemplo: pixels de fundo em imagens de tanques) fazem com que os modelos aprendam padrões irrelevantes. Ataques adversários exploram essas correlações espúrias. Erros de rotulagem, mesmo que de alguns por cento, podem distorcer comparações de referência (benchmarks). Segundo, vazamento de dados: realizar pré-processamento dependente dos dados (centralização, escalonamento, seleção de atributos, aumento de dados) no conjunto de dados completo antes de dividir os dados de teste vaza informações, inflando o desempenho. Viés de antecipação em séries temporais e ajuste excessivo iterativo do conjunto de teste (treinar para o conjunto de teste) são vazamentos comuns. Terceiro, métricas inadequadas: usar acurácia em dados desbalanceados pode ser enganoso. O autor recomenda a lista de verificação REFORMS para ciência baseada em ML e práticas como examinar mapas de saliência, usar múltiplos benchmarks e garantir divisões adequadas dos dados.
Fonte: The Gradient — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas