الأبحاث 🇺🇸 14.08.2026 11:03

أرفف فارغة أم مفاتيح مفقودة؟ الاستدعاء هو عنق الزجاجة للواقعية البارامترية

Google ResearchGoogle Research OpenAIOpenAI Google/DeepMindGoogle/DeepMind
تقدم Google Research التنميط المعرفي، وهو إطار يفصل الترميز عن الاستدعاء في النماذج اللغوية الكبيرة. باستخدام WikiProfile، وهو معيار يضم 2150 حقيقة من ويكيبيديا، وجدوا أن النماذج الحدودية مثل Gemini وGPT-5 ترمّز جميع الحقائق تقريباً ولكنها تكافح لاستدعاء الكثير منها، مما يحول عنق الزجاجة من اكتساب المعرفة إلى استخدامها.
يقترح عالما جوجل للأبحاث نيتاي كالديرون وجال يونا إطارًا سلوكيًا يسمى التنميط المعرفي للتمييز بين ما إذا كانت الأخطاء الواقعية في نماذج اللغات الكبيرة ناتجة عن نقص المعرفة (فشل الترميز) أو عدم القدرة على الوصول إلى المعرفة (فشل الاستدعاء). يقدمان WikiProfile، وهو معيار يتكون من 2150 حقيقة مشتقة من ويكيبيديا، كل منها مقترن بأسئلة تختبر الترميز والاستدعاء والاعتراف. من خلال تقييم 13 نموذج لغوي كبير مع وبدون تفكير، يظهران أن النماذج الحدودية مثل Gemini-3-Pro وGPT-5 تقوم بترميز 95-98% من الحقائق ولكنها تفشل في استدعاء 26-34% منها مباشرة، حتى مع التفكير تفشل في 11-12%. يؤدي التوسع في عائلة Gemma 3 إلى تقليل فشل الترميز لكن فشل الاستدعاء يستمر، مما يشير إلى أن الاستدعاء هو عنق الزجاجة. يتأثر الاستدعاء بسياق التدريب، فالحقائق طويلة الذيل تكون مشفرة لكن يصعب استدعاؤها، وتتم إعادة صياغة لعنة الانعكاس كمشكلة استدعاء، لأن الاعتراف في مهام الاختيار من متعدد لا يكون ضعيفًا. يحسن التفكير الاستدعاء بشكل أكبر للحقائق النادرة والمعكوسة، حيث يستعيد 40-65% من الحقائق المشفرة ولكن غير المعروفة مباشرة، ويعمل كآلية تسهيل للاستدعاء بدلاً من كونه reasoning خالصًا.
المصدر: Google Research — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة