الأبحاثالنماذج 🇷🇺 27.07.2026 10:03

الحشو الرمزي: الضغط المثالي للنصوص لا يحافظ على المعنى – دراسة AIRI

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
أظهر باحثون في AIRI أن طريقة الحشو الرمزي، التي تضغط ما يصل إلى 1568 رمزًا في تضمين واحد، لا تضمن الحفاظ على المعنى: تحت فك التشفير الجشع، تنخفض الدقة من 99.96% إلى 40%. تم اقتراح طريقة جديدة، الحشو التدريجي، لتحقيق استرداد بنسبة 100%، ولكن وُجد أن حتى التضمين المضغوط تمامًا يضعف قدرة النموذج على التفكير، ويكمن السبب في الطبقات المبكرة من المحول.
درس باحثو AIRI طريقة حشو الرموز (token cramming)، التي تضغط ما يصل إلى 1,568 رمزًا في تضمين واحد (embedding) لنموذج لغة كبير مجمد (frozen LLM) بدقة استنساخ تزيد عن 99%. ومع ذلك، عند الانتقال من التلقين الموجَّه (teacher forcing) إلى فك الترميز الجشع (greedy decoding)، تنخفض الدقة إلى 40%، حيث تتركز الأخطاء على الرموز الأولى. اقترح المؤلفون الحشو التدريجي (progressive cramming)، الذي يضمن استنساخًا بنسبة 100% عن طريق إضافة الرموز تدريجيًا واحدًا تلو الآخر. باستخدام هذه الطريقة، قاسوا سعة الضغط لنماذج مختلفة: على سبيل المثال، Llama-3.1-8B يضغط 1,438 رمزًا، ومع الإسقاط منخفض الأبعاد (low-dimensional projection)، يصل إلى 1,697 رمزًا. أظهرت دراسة مسارات التحسين (optimization trajectories) أنها تقع في فضاء فرعي منخفض الأبعاد (30–100 مكونًا). النتيجة الرئيسية: حتى التضمين المضغوط بشكل مثالي، عند إدخاله مع البادئة الأصلية (prefix)، يقلل من الدقة على HellaSwag (من 61.9% إلى 40.8% بالنسبة لـ Llama) وينخفض إلى الصفر على MMLU. السبب يكمن في طبقات المحول (transformer) المبكرة: كشف إلغاء الانتباه (attention knockout) أن التفاعلات في الطبقات الأولى ضرورية لإعادة البناء ولكنها تعيق الفهم. تزداد سعة الضغط بشكل رتيب مع عمق النموذج وعرضه. كما وُجد أن صعوبة ضغط رمز يمكن التنبؤ بها من خلال مفاجأته (surprisal).
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة