De referencias sucias a registros de oro: cómo la IA/ML salva a MDM del caos
La limpieza manual de referencias en la gestión de datos maestros (MDM) es ineficiente; el único camino sostenible es la automatización basada en IA/ML. Los modelos híbridos que combinan clasificación, búsqueda semántica y extracción inteligente de atributos permiten una normalización de atributos más rápida y precisa, transformando el caos de datos en registros de oro unificados.
El artículo explora las causas de la degradación del NSI: sistemas de información paralelos, diferentes enfoques de entrada de datos, el factor humano, la incompletitud y los estándares obsoletos. Los algoritmos simples de comparación de cadenas (distancia de Damerau-Levenshtein, Jaro-Winkler) logran una calidad aceptable solo en el 30–40% de los casos, ya que no tienen en cuenta la semántica, la morfología ni el contexto, lo que puede provocar fusiones falsas de objetos fundamentalmente diferentes. El único camino confiable es la normalización de atributos, que consta de cinco fases: auditoría y análisis, estructuración y enriquecimiento, limpieza con creación de referencias, publicación e integración, y mantenimiento y mejora. Usando el servicio SOFROS AI/ML como ejemplo, se muestra cómo el aprendizaje automático y los modelos de lenguaje de gran tamaño (LLMs, por sus siglas en inglés) automatizan la clasificación, extracción de atributos y normalización, mejorando la calidad y completitud de los datos.
Fuente: Habr — хаб ИИ —
original
