Zidong Taichu giới thiệu phương pháp cắt tỉa GMC Coreset: Giữ nguyên khả năng đa phương thức với ít hơn 80% token
Nhóm mô hình lớn Zidong Taichu tại Viện Tự động hóa, Viện Hàn lâm Khoa học Trung Quốc, đã phát triển GMC (Grounded Message Coreset Pruning), một phương pháp cắt tỉa coreset không cần huấn luyện giúp giảm tới 90% số token hình ảnh trong khi vẫn bảo toàn hơn 99% hiệu suất trung bình của mô hình. GMC giải quyết vấn đề dư thừa token hình ảnh trong các mô hình ngôn ngữ-thị giác, cung cấp giải pháp cắm-và-chạy tương thích với các mô hình phổ biến như Qwen và LLaVA.
Nhóm Zidong Taichu thuộc Viện Hàn lâm Khoa học Trung Quốc đã giới thiệu GMC (Grounded Message Coreset Pruning), một phương pháp cắt tỉa tập lõi mới dành cho các mô hình thị giác-ngôn ngữ. Các token hình ảnh thường dư thừa, khiến mức sử dụng bộ nhớ GPU (Graphics Processing Unit – bộ xử lý đồ họa) tăng cao và quá trình suy luận bị chậm lại. Phương pháp lọc token Top-K truyền thống chỉ giữ lại những token có điểm cao, vốn tập trung ở các vùng nổi bật, dẫn đến mất mát thông tin và hiện tượng ảo giác thị giác. GMC sử dụng kiến trúc hai giai đoạn: lựa chọn thích ứng theo bằng chứng bổ sung và vận chuyển quần thể. Giai đoạn đầu tiên chọn ra các token quan trọng dựa trên mức độ đóng góp của chúng trong việc bao phủ những bằng chứng chưa được bao phủ, đồng thứng xem xét cả ba khía cạnh ngữ nghĩa, thị giác và không gian. Giai đoạn thứ hai tổng hợp các trạng thái ẩn của những token bị xóa vào các token đại diện, giúp bảo toàn thông tin mà không cần huấn luyện. GMC hoàn toàn không cần huấn luyện, không đòi hỏi nhãn tác vụ, mô hình OCR (Optical Character Recognition – nhận dạng ký tự quang học) hay các công cụ bên ngoài, đồng thứng tương thích với các mô hình Qwen2.5-VL và LLaVA-1.5. Kết quả thí nghiệm cho thấy khi cắt giảm 80,2% số token (từ 1296 xuống còn 256), GMC vẫn giữ được 97,78% hiệu năng trung bình của mô hình đầy đủ trên các bộ đánh giá như TextVQA, ChartQA và MME. Với mức giảm 90,1%, tỷ lệ này đạt 99,11%. Trên LLaVA-1.5, khi chỉ còn 128 và 64 token, GMC vẫn duy trì lần lượt 99,76% và 99,82% hiệu năng. GMC cũng giúp giảm ảo giác thị giác trên các bộ đánh giá POPE, AMBER và HallusionBench. Trong tác vụ hỏi đáp (QA – Question Answering) với tài liệu dài, phương pháp này đạt tốc độ nhanh hơn 1,258 lần, giảm 73,94% bộ nhớ đệm khóa-giá trị (KV Cache – Key-Value Cache) và vẫn giữ được 98,87% chất lượng câu trả lứng. Bài báo hiện đã có sẵn trên arXiv.
Nguồn: QbitAI 量子位 —
bản gốc
