Apprendre à l'IA à comprendre les graphiques : analyse du nouveau dataset ChartNet du MIT
IBM
Alibaba/Qwen
Google/DeepMind
OpenAI
Hugging Face
Des chercheurs du MIT et d'IBM Research ont présenté un dataset multimodal appelé ChartNet pour former et tester des modèles sur l'analyse de graphiques. Le dataset comprend 1,7 million d'exemples synthétiques couvrant 24 types de visualisations, avec vérification automatique et sous-ensembles validés manuellement. Le fine-tuning de modèles VLM ouverts sur ChartNet a permis à des modèles de 2 à 7 milliards de paramètres de rivaliser avec de grands systèmes, dépassant parfois GPT-4o.
Des chercheurs du Massachusetts Institute of Technology (MIT) et d'IBM Research ont créé ChartNet, un jeu de données multimodal pour l'apprentissage de modèles visuels-linguistiques (VLM) à la compréhension de graphiques. Le principal problème des VLM existants est le manque de données de qualité et diversifiées : GPT-4o ne répond correctement qu'à 46 % des tâches de l'examen d'État de base, Gemini 2.5 Flash à 65 %, et Qwen3.7 Plus à 83 %. ChartNet résout ce problème par la génération synthétique à partir de code : à partir de 150 000 graphiques TinyChart, un VLM reconstruit le code Python, puis un LLM effectue des augmentations en modifiant le type de visualisation, la bibliothèque (Matplotlib, Seaborn, Plotly, Vega-Altair, Pygal, Plotnine), les données et la mise en forme. Au final, 1,7 million d'exemples ont été obtenus pour quatre tâches : reconstruction de code, extraction de tableau, description textuelle et réponses à des questions avec raisonnement. Le contrôle qualité comprend un filtrage du code non exécutable (77 % de réussite), une vérification automatique des défauts (taux de défauts réduit de 15 % à 6 %), un ensemble vérifié manuellement de 100 000 exemples, 30 000 graphiques réels et 7 600 exemples pour des sujets sensibles. Le fine-tuning sur ChartNet a considérablement amélioré les métriques des VLM ouverts : les modèles compacts (2 à 7 milliards de paramètres) sont devenus compétitifs avec les grands modèles, et Granite-Vision-3.3-2B a obtenu le meilleur résultat dans cinq des sept métriques, surpassant GPT-4o. La généralisabilité a été confirmée sur les bancs d'essai ChartCap et ChartMimic-v2, avec des métriques en hausse sans exception. Limites : erreurs de génération possibles dues à l'utilisation de LLM/VLM, écart potentiel de distribution entre données synthétiques et réelles, applicabilité incertaine de l'effet pour les modèles puissants.
Source: Habr — хаб NLP —
original
