Claude Fable 5 يتفوق على GPT-5.6 في إعادة كتابة الأكواد من الصفر: إليك السبب
Anthropic
OpenAI
يُظهر معيار MirrorCode من Epoch AI أن Claude Fable 5 يحل 64% من المهام مقارنة بـ 20% لـ GPT-5.6 Sol. يعود الفارق إلى الموثوقية، وليس القدرة الخام: غالبًا ما يحل Sol المهام جزئيًا، بينما يكملها Fable باستمرار. أداء Fable القوي في لغة Ada، التي تفتقر إلى بيانات تدريبية وفيرة، يشير إلى مهارة حقيقية وليس حفظًا.
قامت Epoch AI بتحديث لوحة صدارتها MirrorCode، مما كشف أن نموذج Claude Fable 5 من Anthropic قد حل 64% من المهام، بينما تمكن نموذج GPT-5.6 Sol من OpenAI من حل 20% فقط. هذا الفارق الثلاثي يبدو شاذًا بالنظر إلى أن النموذجين يحققان نتائج متشابهة في اختبارات أخرى، لكن Epoch AI وAnthropic لم يقدما أي تفسير رسمي. تم تطوير MirrorCode بالتعاون مع METR، ويتطلب من النماذج إعادة كتابة برامج كاملة من الصفر، حيث لا ترى سوى 'صندوق أسود' قابل للتنفيذ، ووثائق، واختبارات مرئية؛ ويجب أن تجتاز الحلول جميع الاختبارات المخفية. يتضمن المعيار 15 برنامجًا حقيقيًا مثل sed وRuff، كل منها مطبق بلغتين، مع ميزانية قدرها 10 مليارات رمز و7 أيام لكل محاولة. يُظهر تحليل الخريطة الحرارية أن Sol غالبًا ما يحل المهام جزئيًا (معدلات نجاح 50%، 33%، 17%)، بينما يكمل Fable المهام دائمًا تقريبًا (100%، 83%). دليل آخر: أداء Fable ينخفض بشكل طفيف فقط على لغة Ada (61% مقابل 64% على Go)، بينما تنخفض أداء نماذج OpenAI بشكل كبير على Ada — Sol ينخفض من 24% إلى 19%، وGPT-5.4 من 21% إلى 12%، وGPT-5.5 من 17% إلى 5%. نظرًا لعدم وجود أي تطبيقات Ada تقريبًا لهذه البرامج في بيانات التدريب، فإن مرونة Fable مع Ada تشير إلى مهارة حقيقية وليس حفظًا. ومع ذلك، وجد فحص التلوث الخاص بـ Epoch علامات على الحفظ في 17 من أصل 25 برنامجًا، كما أن إعداد المواصفات الدقيقة للمعيار يختلف عن التطوير في العالم الحقيقي.
المصدر: Habr — хаб ИИ —
الأصلي
