Cómo enseñar a la IA a entender gráficos: analizando el nuevo conjunto de datos ChartNet del MIT
IBM
Alibaba/Qwen
Google/DeepMind
OpenAI
Hugging Face
Investigadores del MIT e IBM Research han presentado un conjunto de datos multimodal llamado ChartNet para entrenar y evaluar modelos en el análisis de gráficos. El conjunto incluye 1,7 millones de ejemplos sintéticos que cubren 24 tipos de visualización, con verificación automática y subconjuntos validados manualmente. El ajuste fino de modelos VLM abiertos en ChartNet permitió que modelos con 2 a 7 mil millones de parámetros compitieran con sistemas grandes, superando ocasionalmente a GPT-4o.
Investigadores del Instituto Tecnológico de Massachusetts (MIT) e IBM Research han creado ChartNet, un conjunto de datos multimodal para entrenar modelos de lenguaje y visión (VLM, por sus siglas en inglés) en la comprensión de gráficos. El principal problema de los VLM existentes es la falta de datos diversos y de calidad: GPT-4o responde correctamente solo al 46% de las tareas del Examen Estatal Unificado, Gemini 2.5 Flash al 65% y Qwen3.7 Plus al 83%. ChartNet aborda este problema mediante la generación sintética basada en código: a partir de 150 mil gráficos de TinyChart, un VLM reconstruye el código Python; luego, un modelo de lenguaje grande (LLM, por sus siglas en inglés) realiza aumentaciones: cambia el tipo de visualización, la biblioteca (Matplotlib, Seaborn, Plotly, Vega-Altair, Pygal, Plotnine), los datos y el estilo. Como resultado, se obtuvieron 1,7 millones de ejemplos para cuatro tareas: reconstrucción de código, extracción de tablas, descripción textual y preguntas y respuestas con razonamiento. El control de calidad incluye el filtrado de código no ejecutable (tasa de éxito del 77%), la verificación automática de defectos (la tasa de rechazo se redujo del 15% al 6%), un conjunto verificado manualmente de 100 mil ejemplos, 30 mil gráficos reales y 7600 ejemplos para temas sensibles. El ajuste fino con ChartNet mejoró significativamente las métricas de los VLM de código abierto: los modelos compactos (de 2 a 7 mil millones de parámetros) comenzaron a competir con los grandes, y Granite-Vision-3.3-2B obtuvo el mejor resultado en cinco de siete métricas, superando a GPT-4o. La capacidad de generalización se confirmó en los puntos de referencia ChartCap y ChartMimic-v2, con métricas mejoradas en todos los casos. Limitaciones: posibles errores de generación debido al uso de LLM/VLM, posible discrepancia en la distribución de datos sintéticos con respecto a los reales, y aplicabilidad no clara del efecto para modelos potentes.
Fuente: Habr — хаб NLP —
original
