ConvApparel: قياس وسد فجوة الواقعية في محاكيات المستخدم القائمة على نماذج اللغة الكبيرة
Google/DeepMind
تقدم جوجل ريسيرش (Google Research) مجموعة بيانات جديدة للحوار بين الإنسان والذكاء الاصطناعي تسمى ConvApparel وإطار تقييم ثلاثي الأركان لقياس وتقليل "فجوة الواقعية" في محاكيات المستخدم القائمة على نماذج اللغة الكبيرة. يشمل الإطار إحصائيات على مستوى المجموعة السكانية، وتسجيل التشابه البشري، والتحقق العكسي، ويُطبق على المحاكيات المبنية باستخدام نماذج جيميني (Gemini). تظهر النتائج أن المحاكيات المبنية على البيانات (التعلم في السياق والضبط الدقيق الخاضع للإشراف) تتفوق على تلك المبنية على التوجيهات، ولكن حتى أفضل النماذج لا تزال تظهر قطعًا أثرية اصطناعية دقيقة.
قدم الباحثان من جوجل للأبحاث، أوفر ميشي وسالي جولدمان، مجموعة بيانات جديدة وإطار تقييم يسمى ConvApparel، مصمم لقياس وتحسين واقعية المحاكاة التي تعتمد على نماذج اللغة الكبيرة. تتكون مجموعة البيانات من أكثر من 4000 محادثة متعددة الأدوار بين البشر والذكاء الاصطناعي (ما يقرب من 15000 جولة) في مجال تسوق الملابس، تم جمعها باستخدام بروتوكول وكيل مزدوج حيث يتم توجيه المستخدمين عشوائيًا إما إلى وكيل مفيد (جيد) أو إلى وكيل غير مفيد عمدًا (سيء). يتضمن الإطار ثلاثة محاور رئيسية: إحصائيات على مستوى المجتمع، وتقييم التشابه البشري عبر مميز آلي، والتحقق من الفرضيات المضادة. باستخدام مجموعة نماذج Gemini، تم اختبار ثلاث محاكيات: نموذج أساسي قائم على التوجيه، ومحاكي تعليم سياقي مع استرجاع محسن، ومحاكي ضبط دقيق خاضع للإشراف. أظهرت النتائج أن المحاكيات المعتمدة على البيانات (التعليم السياقي والضبط الدقيق الخاضع للإشراف) تفوقت على النموذج الأساسي القائم على التوجيه، حيث عكست سلوك البشر عن كثب في اختبارات المستوى السكاني، لكن جميع المحادثات المحاكاة تم التعرف عليها بثقة باعتبارها اصطناعية من قبل مميز التشابه البشري. أظهر التحقق من الفرضيات المضادة أن المحاكيات المعتمدة على التعليم السياقي والضبط الدقيق الخاضع للإشراف يمكنها التكيف مع الوكيل (السيء) غير المرئي من خلال إظهار إحباط متزايد، بينما بقي النموذج الأساسي القائم على التوجيه مهذبًا بشكل غير طبيعي. يسلط البحث الضوء على فجوة الواقعية المستمرة ويوفر أدوات لسدها.
المصدر: Google Research —
الأصلي
