How to Teach AI to Understand Charts: Analyzing the New ChartNet Dataset from MIT
IBM
Alibaba/Qwen
Google/DeepMind
OpenAI
Hugging Face
Researchers from MIT and IBM Research have introduced a multimodal dataset called ChartNet for training and testing models on chart analysis. The dataset includes 1.7 million synthetic examples covering 24 visualization types, with automatic verification and manually validated subsets. Fine-tuning open VLM models on ChartNet allowed models with 2–7 billion parameters to compete with large systems, occasionally surpassing GPT-4o.
Массачусетс технологиялық институты (MIT) мен IBM Research зерттеушілері графиктерді түсіну үшін визуалды-тілдік модельдерді (VLM) оқытуға арналған ChartNet мультимодальды деректер жинағын жасады. Қолданыстағы VLM модельдерінің басты мәселесі – сапалы және әртүрлі деректердің жетіспеушілігі: GPT-4o негізгі мемлекеттік емтихан (ОГЭ) тапсырмаларының тек 46%-ына, Gemini 2.5 Flash – 65%-ына, ал Qwen3.7 Plus – 83%-ына дұрыс жауап береді. ChartNet бұл мәселені код негізіндегі синтетикалық генерация арқылы шешеді: TinyChart жинағындағы 150 мың графиктен VLM көмегімен Python коды қалпына келтіріледі, содан кейін үлкен тілдік модель (LLM) аугментацияларды орындайды – визуализация түрін, кітапхананы (Matplotlib, Seaborn, Plotly, Vega-Altair, Pygal, Plotnine), деректер мен безендіруді өзгертеді. Нәтижесінде төрт тапсырма үшін 1,7 млн мысал алынды: кодты қалпына келтіру, кестені алу, мәтіндік сипаттама және пайымдау арқылы сұрақтарға жауап беру. Сапаны бақылау орындалмайтын кодты сүзуді (77% сәттілік), ақауларды автоматты тексеруді (ақау үлесі 15%-дан 6%-ға дейін төмендеді), қолмен тексерілген 100 мың мысал жинағын, 30 мың нақты графиктерді және сезімтал тақырыптарға арналған 7600 мысалды қамтиды. ChartNet-те дообучение ашық VLM көрсеткіштерін айтарлықтай жақсартты: ықшам модельдер (2–7B параметрлер) ірі модельдермен бәсекелесе бастады, Granite-Vision-3.3-2B жеті көрсеткіштің бесеуінде үздік нәтиже көрсетіп, GPT-4o-дан асып түсті. Жалпыламалық ChartCap және ChartMimic-v2 бенчмарктарында расталды – көрсеткіштер ерекшеліксіз өсті. Шектеулер: LLM/VLM пайдалану салдарынан генерация қателерінің ықтималдығы, синтетикалық деректердің таралуының нақтыдан ықтимал алшақтығы, күшті модельдер үшін әсердің анық емес қолданылуы.
Kaynak: Habr — хаб NLP —
orijinal
