Nghiên cứuMô hình 🇷🇺 27.07.2026 01:05

How to Teach AI to Understand Charts: Analyzing the New ChartNet Dataset from MIT

IBMIBM Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind OpenAIOpenAI Hugging FaceHugging Face
Researchers from MIT and IBM Research have introduced a multimodal dataset called ChartNet for training and testing models on chart analysis. The dataset includes 1.7 million synthetic examples covering 24 visualization types, with automatic verification and manually validated subsets. Fine-tuning open VLM models on ChartNet allowed models with 2–7 billion parameters to compete with large systems, occasionally surpassing GPT-4o.
Các nhà nghiên cứu từ Viện Công nghệ Massachusetts (MIT) và IBM Research đã tạo ra ChartNet — một bộ dữ liệu đa phương thức để huấn luyện mô hình ngôn ngữ-thị giác (VLM - Vision-Language Model) hiểu biểu đồ. Vấn đề chính của các VLM hiện tại là thiếu dữ liệu chất lượng và đa dạng: GPT-4o chỉ trả lời đúng 46% câu hỏi từ kỳ thi OGE (kỳ thi cơ bản nhà nước), Gemini 2.5 Flash đạt 65%, Qwen3.7 Plus đạt 83%. ChartNet giải quyết vấn đề này bằng cách sinh tổng hợp dựa trên mã nguồn: từ 150 nghìn biểu đồ TinyChart, mã nguồn Python được tái tạo qua VLM, sau đó mô hình ngôn ngữ lớn (LLM - Large Language Model) thực hiện các phép tăng cường dữ liệu — thay đổi loại hình trực quan, thư viện (Matplotlib, Seaborn, Plotly, Vega-Altair, Pygal, Plotnine), dữ liệu và thiết kế. Kết quả thu được 1,7 triệu mẫu cho bốn nhiệm vụ: tái tạo mã nguồn, trích xuất bảng, mô tả văn bản và trả lời câu hỏi kèm lập luận. Kiểm soát chất lượng bao gồm: lọc mã nguồn không thực thi được (tỉ lệ thành công 77%), kiểm tra lỗi tự động (tỉ lệ lỗi giảm từ 15% xuống 6%), bộ dữ liệu 100 nghìn mẫu kiểm thủ công, 30 nghìn biểu đồ thực tế và 7.600 mẫu cho các chủ đề nhạy cảm. Huấn luyện thêm trên ChartNet cải thiện đáng kể các chỉ số của VLM mã nguồn mở: các mô hình nhỏ gọn (2–7 tỷ tham số) có thể cạnh tranh với các mô hình lớn, Granite-Vision-3.3-2B đạt kết quả tốt nhất ở năm trong số bảy chỉ số, vượt qua GPT-4o. Khả năng tổng quát hóa được xác nhận trên các bộ benchmark ChartCap và ChartMimic-v2 — các chỉ số đều tăng mà không có ngoại lệ. Hạn chế: có thể có lỗi sinh do sử dụng LLM/VLM, phân phối dữ liệu tổng hợp có thể sai lệch so với thực tế, hiệu quả đối với các mô hình mạnh chưa rõ ràng.
Nguồn: Habr — хаб NLP — bản gốc
Bài viết liên quan trước đây ↓
Tin mới