연구모델 🇷🇺 27.07.2026 01:05

How to Teach AI to Understand Charts: Analyzing the New ChartNet Dataset from MIT

IBMIBM Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind OpenAIOpenAI Hugging FaceHugging Face
Researchers from MIT and IBM Research have introduced a multimodal dataset called ChartNet for training and testing models on chart analysis. The dataset includes 1.7 million synthetic examples covering 24 visualization types, with automatic verification and manually validated subsets. Fine-tuning open VLM models on ChartNet allowed models with 2–7 billion parameters to compete with large systems, occasionally surpassing GPT-4o.
Исследователи из Массачусетского технологического института (MIT) и IBM Research создали ChartNet — мультимодальный датасет для обучения визуально-языковых моделей (VLM) пониманию графиков. Основная проблема существующих VLM — нехватка качественных и разнообразных данных: GPT-4o отвечает правильно лишь на 46% задач из ОГЭ, Gemini 2.5 Flash — 65%, Qwen3.7 Plus — 83%. ChartNet решает эту проблему с помощью синтетической генерации на основе кода: из 150 тысяч графиков TinyChart через VLM восстанавливается Python-код, затем LLM выполняет аугментации — меняет тип визуализации, библиотеку (Matplotlib, Seaborn, Plotly, Vega-Altair, Pygal, Plotnine), данные и оформление. В итоге получено 1,7 млн примеров для четырёх задач: восстановление кода, извлечение таблицы, текстовое описание и ответы на вопросы с рассуждением. Контроль качества включает фильтрацию невыполнимого кода (77% успеха), автоматическую проверку дефектов (доля брака снижена с 15% до 6%), вручную проверенный набор из 100 тысяч примеров, 30 тысяч реальных графиков и 7600 примеров для чувствительных тем. Дообучение на ChartNet значительно повысило метрики открытых VLM: компактные модели (2–7B параметров) стали конкурировать с крупными, Granite-Vision-3.3-2B показал лучший результат в пяти из семи метрик, обойдя GPT-4o. Обобщаемость подтверждена на бенчмарках ChartCap и ChartMimic-v2 — метрики выросли без исключения. Ограничения: возможные ошибки генерации из-за использования LLM/VLM, потенциальное расхождение распределения синтетических данных с реальным, неясная применимость эффекта для сильных моделей.
출처: Habr — хаб NLP — 원문
관련 게시물 ↓
새로운 뉴스