الأبحاثالنماذج 🇨🇳 12.08.2026 16:01

زي دونغ تايتشو تقدم طريقة GMC لتقليص المجموعة الأساسية: تحتفظ بالقدرة الكاملة متعددة الوسائط مع تقليل الرموز بنسبة 80%

طور فريق نموذج زي دونغ تايتشو الكبير في معهد الأتمتة التابع للأكاديمية الصينية للعلوم طريقة GMC (تقليص المجموعة الأساسية المستندة إلى الرسائل)، وهي طريقة تقليص للمجموعة الأساسية دون تدريب تقلل الرموز البصرية بنسبة تصل إلى 90% مع الحفاظ على أكثر من 99% من متوسط أداء النموذج. تعالج GMC التكرار في الرموز البصرية في النماذج البصرية اللغوية، وتقدم حلاً جاهزًا للاستخدام متوافقًا مع النماذج الرئيسية مثل Qwen وLLaVA.
قدّم فريق Zidong Taichu التابع للأكاديمية الصينية للعلوم طريقة GMC (Grounded Message Coreset Pruning، أي تقليم المجموعة الأساسية للرسائل المؤسَّسة)، وهي تقنية جديدة لتقليم المجموعات الأساسية في نماذج الرؤية واللغة. فالرموز المرئية غالبًا ما تكون زائدة عن الحاجة، مما يؤدي إلى استهلاك مرتفع لذاكرة وحدة معالجة الرسوميات (GPU) وبطء في الاستدلال. وأساليب الترشيح التقليدية المعتمدة على Top-K تحتفظ فقط بالرموز الأعلى تقييمًا، والتي تتركز في المناطق البارزة من الصورة، مما يؤدي إلى فقدان المعلومات وظهور هلوسات بصرية. تعتمد GMC على بنية ثنائية المراحل: الانتقاء التكيفي للأدلة المتكاملة، ثم نقل المجتمع (population transport). تختار المرحلة الأولى الرموز الأساسية بناءً على مساهمتها في تغطية الأدلة غير المغطاة، مع مراعاة الجوانب الدلالية والمرئية والمكانية. أما المرحلة الثانية فتدمج الحالات الخفية للرموز المحذوفة في رموز تمثيلية، بما يحافظ على المعلومات دون الحاجة إلى أي تدريب. وGMC لا تتطلب تدريبًا، ولا تحتاج إلى وسوم خاصة بالمهام أو نماذج التعرف الضوئي على الأحرف (OCR) أو أدوات خارجية، وتعمل مع نموذجي Qwen2.5-VL وLLaVA-1.5. تُظهر التجارب أنه مع تقليص الرموز بنسبة 80.2% (من 1296 إلى 256 رمزًا)، تحتفظ GMC بنسبة 97.78% من متوسط أداء النموذج الكامل على معايير مثل TextVQA وChartQA وMME. ومع تقليص بنسبة 90.1%، تحتفظ بنسبة 99.11%. وعلى نموذج LLaVA-1.5، مع 128 و64 رمزًا، تحتفظ بنسبتي 99.76% و99.82% على التوالي. كما تقلل GMC من الهلوسات البصرية على معايير POPE وAMBER وHallusionBench. وفي مهام الإجابة عن الأسئلة (QA) المتعلقة بالمستندات الطويلة، تحقق تسريعًا بمقدار 1.258 ضعف، وتخفض ذاكرة التخزين المؤقت للمفاتيح والقيم (KV Cache) بنسبة 73.94%، مع الحفاظ على 98.87% من جودة الإجابات. الورقة البحثية متاحة على arXiv.
المصدر: QbitAI 量子位 — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة