Investigación 🇺🇸 28.07.2026 17:04

¿Por qué no funciona mi modelo?

El artículo analiza los errores comunes en aprendizaje automático que hacen que los modelos fallen en aplicaciones reales a pesar de parecer buenos durante las pruebas. Los problemas clave incluyen datos engañosos (variables ocultas, correlaciones espurias, errores de etiquetado), fuga de datos (preprocesamiento antes de dividir, sesgo de look-ahead, sobreajuste iterativo del conjunto de prueba) y elección inapropiada de métrica (por ejemplo, precisión en datos desbalanceados). El autor recomienda la lista de verificación REFORMS y prácticas como el uso de mapas de prominencia, puntos de referencia diversos y divisiones adecuadas de datos para mejorar la fiabilidad del modelo.
El artículo, basado en los 20 años de experiencia en aprendizaje automático del autor y en el artículo 'How to avoid machine learning pitfalls: a guide for academic researchers', describe errores comunes que llevan a que los modelos fallen en producción. Primero, datos engañosos: las variables ocultas (por ejemplo, la orientación del cuerpo en escáneres de pulmón por Covid) y las correlaciones espurias (por ejemplo, píxeles de fondo en imágenes de tanques) hacen que los modelos aprendan patrones irrelevantes. Los ataques adversariales explotan estas correlaciones espurias. Los errores de etiquetado, incluso de unos pocos por ciento, pueden distorsionar las comparaciones de referencia. Segundo, fuga de datos: realizar preprocesamiento dependiente de los datos (centrado, escalado, selección de características, aumento de datos) en el conjunto de datos completo antes de dividir los datos de prueba filtra información, inflando el rendimiento. El sesgo de anticipación en la predicción de series temporales y el sobreajuste iterativo del conjunto de prueba (entrenar hasta el conjunto de prueba) son fugas comunes. Tercero, métricas inapropiadas: usar la precisión en datos desbalanceados puede ser engañoso. El autor recomienda la lista de verificación REFORMS para la ciencia basada en aprendizaje automático y prácticas como examinar mapas de saliencia, usar múltiples puntos de referencia y garantizar divisiones de datos adecuadas.
Fuente: The Gradient — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas