الأبحاث 🇷🇺 27.07.2026 10:03

الحشو الرمزي: الضغط المثالي للنص لا يحافظ على المعنى – دراسة AIRI

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
حدد باحثون من AIRI (FusionBrain) مشكلات حاسمة في طريقة الحشو الرمزي، التي تسمح بتعبئة آلاف الرموز في تضمين واحد. اتضح أنه حتى مع دقة استرجاع تبلغ 99.96%، يفقد النموذج قدرته على الاستدلال على النص المضغوط. تم اقتراح بروتوكول جديد يسمى الحشو التصاعدي التدريجي، يضمن استرجاعًا بنسبة 100% لكنه يظهر أن استرجاع النص لا يساوي الفهم.
قدمت مجموعة من الباحثين من مختبر FusionBrain في AIRI بقيادة دميتري تاراسوف في مؤتمر ICML 2026 عملاً ينتقد بشكل حاد طريقة token cramming، وهي ضغط مئات وآلاف من التوكينات النصية في إمبدينغ إدخال واحد لنموذج لغوي كبير مجمد. أظهر عمل سابق للزميل يوري كوراتوف (AIRI) أنه يمكن "تعبئة" ما يصل إلى 1568 توكينًا في متجه واحد بدقة إعادة بناء تبلغ 99.96% عند استخدام التوجيه القسري للمعلم. ومع ذلك، كشف التحليل الجديد أن الأخطاء تتركز في المواضع الأولى، وهو أمر قاتل للتوليد الانحداري الذاتي: في حالة فك الترميز الجشع، تنخفض الدقة إلى 40% بالنسبة لنموذج Llama-3.1-8B. اقترح المؤلفون طريقة progressive cramming، التي تزيد طول البادئة بمقدار توكين واحد في كل مرة، مما يضمن إعادة بناء بنسبة 100% في كل خطوة. باستخدام هذه الطريقة، تم قياس سعة النماذج المختلفة: Llama-3.1-8B يضغط في المتوسط 1438 توكينًا، وPythia-1.4B يضغط 430، وSmolLM2-1.7B يضغط 335، وGemma-3-4B يضغط 214. يؤدي استخدام الإسقاط منخفض الأبعاد إلى زيادة السعة بمقدار 1.2 إلى 3.3 مرة. أظهر تحليل مسارات التحسين أن مسار المحسّن في فضاء الإمبدينغات يقع في فضاء فرعي منخفض الأبعاد (30-100 مكونًا)، على الرغم من أن مجموعة الحلول عالية الأبعاد. النتيجة الرئيسية: إعادة البناء المثالية لا تضمن الحفاظ على المعنى. تؤدي إضافة الإمبدينغ المضغوط إلى السياق إلى تقليل الدقة في اختباري HellaSwag وARC-Easy (على سبيل المثال، بالنسبة لنموذج Llama-3.1-8B من 61.9% إلى 40.8% في HellaSwag)، وفي اختبار 5-shot MMLU تنخفض الدقة إلى ما يقرب من الصفر. السبب يكمن في الطبقات المبكرة للمحول: إسكات الانتباه إلى الإمبدينغ في الطبقات المبكرة يعيد القدرة على التفكير. تزداد سعة الضغط مع عمق وعرض النموذج؛ بالنسبة لنموذج SmolLM2، تضغط الطبقات الثماني الأولى أكثر من النموذج الكامل.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة