AI leren grafieken begrijpen: analyse van de nieuwe ChartNet-dataset van MIT
IBM
Alibaba/Qwen
Google/DeepMind
OpenAI
Hugging Face
Onderzoekers van MIT en IBM Research hebben een multimodale dataset genaamd ChartNet geïntroduceerd voor het trainen en testen van modellen op het gebied van grafiekanalyse. De dataset bevat 1,7 miljoen synthetische voorbeelden die 24 visualisatietypen bestrijken, met automatische verificatie en handmatig gevalideerde subsets. Het fine-tunen van open VLM-modellen op ChartNet stelde modellen met 2–7 miljard parameters in staat om te concurreren met grote systemen en af en toe GPT-4o te overtreffen.
Onderzoekers van het Massachusetts Institute of Technology (MIT) en IBM Research hebben ChartNet gecreëerd, een multimodale dataset voor het trainen van visueel-linguïstische modellen (VLM) om grafieken te begrijpen. Het grootste probleem van bestaande VLM's is het gebrek aan kwalitatieve en diverse gegevens: GPT-4o antwoordt correct op slechts 46% van de taken uit het Russische staatsexamen OGE, Gemini 2.5 Flash op 65%, en Qwen3.7 Plus op 83%. ChartNet lost dit probleem op met synthetische generatie op basis van code: uit 150.000 grafieken van TinyChart wordt via een VLM Python-code gereconstrueerd, waarna een groot taalmodel (LLM) augmentaties uitvoert, zoals het wijzigen van het visualisatietype, de gebruikte bibliotheek (Matplotlib, Seaborn, Plotly, Vega-Altair, Pygal, Plotnine), de gegevens en de vormgeving. Dit resulteert in 1,7 miljoen voorbeelden voor vier taken: codeherstel, tabel extractie, tekstuele beschrijving en het beantwoorden van vragen met redenering. Kwaliteitscontrole omvat het filteren van onuitvoerbare code (77% succes), automatische foutdetectie (uitvalpercentage verlaagd van 15% naar 6%), een handmatig gecontroleerde set van 100.000 voorbeelden, 30.000 echte grafieken en 7.600 voorbeelden voor gevoelige onderwerpen. Verfijning met ChartNet heeft de metrieken van open VLM's aanzienlijk verbeterd: compacte modellen (2–7 miljard parameters) concurreren nu met grotere modellen; Granite-Vision-3.3-2B behaalde het beste resultaat op vijf van de zeven metrieken, waarmee het GPT-4o overtrof. Generaliseerbaarheid werd bevestigd op de benchmarks ChartCap en ChartMimic-v2: alle metrieken stegen. Beperkingen: mogelijke generatiefouten door het gebruik van LLM/VLM, een mogelijke discrepantie in de verdeling van synthetische en echte gegevens, en onduidelijke toepasbaarheid van het effect op sterke modellen.
Bron: Habr — хаб NLP —
origineel
