الأبحاثالعوامل 🇩🇪 14.08.2026 19:10

دراسة تناقض Anthropic وOpenAI: أبحاث الذكاء الاصطناعي المستقلة لا تزال بعيدة

AnthropicAnthropic OpenAIOpenAI Sakana AISakana AI Google DeepMindGoogle DeepMind
وجدت دراسة جديدة بمشاركة جامعة برينستون ومعهد أمان الذكاء الاصطناعي البريطاني أن نماذج الذكاء الاصطناعي الرائدة الحالية تفشل في إجراء أبحاث ذكاء اصطناعي مستقلة، على الرغم من ادعاءات مختبرات كبرى مثل Anthropic وOpenAI. باستخدام طريقة 'التقييم الظلي' مع أوراق NeurIPS غير المنشورة، رفض المؤلفون البشريون جميع الأعمال المولدة بالذكاء الاصطناعي. واجهت الوكلاء صعوبات في الحكم العلمي وحل المشكلات الإبداعي وإدارة الموارد.
أجرى باحثون من جامعة برينستون ومعهد أمن الذكاء الاصطناعي في المملكة المتحدة دراسة لاختبار ما إذا كانت وكلاء الذكاء الاصطناعي قادرين على إجراء أبحاث مستقلة في مجال الذكاء الاصطناعي. استخدموا طريقة تسمى 'التقييم الخفي'، حيث تم إعطاء وكلاء الذكاء الاصطناعي سؤال البحث المركزي من أوراق غير منشورة، وقام المؤلفون البشريون الأصليون بتقييم النتائج مثل مراجعي المؤتمرات. استخدم الوكلاء نموذج كلود أوبوس 4.8 مع تفكير إضافي عالي، واستمرت التجربة لمدة ستة أيام بميزانية قدرها 3000 دولار أمريكي لواجهة برمجة التطبيقات، مع إمكانية الوصول إلى وحدات معالجة الرسوميات والإنترنت، داخل إطار عمل OpenClaw. رفض المؤلفون الأصليون كلتا الورقتين الناتجتين عن الذكاء الاصطناعي، إحداهما بـ'رفض قوي'، مستشهدين ببيانات ضعيفة الدافع، ونثر غير مقروء، وعدم وجود مساهمات جديدة. حدد التحليل خمسة نقاط ضعف منهجية: نقص الحكم على جودة الأبحاث القابلة للنشر، والفشل في حل المشكلات الإبداعي (حيث قام الوكلاء بتضييق الادعاءات بدلاً من توليد فرضيات جديدة)، وعدم فعالية التراجع (التخلي عن الأهداف الطموحة قبل الأوان)، ونقص الوعي بالموارد (استخدم الوكلاء أقل من نصف ميزانيتهم)، وانحراف التعليمات (نسيان التعليمات الصريحة، وتجاوز حدود الطول). في المقابل، نجح الوكلاء في جميع الأعمال الهندسية، بما في ذلك البحث في الأدبيات، وتصحيح أخطاء كود معالجة الرسوميات، وتشغيل مئات التجارب، وتجميع أوراق اللاتكس. لم يتم العثور على اختراق جوهري للمكافآت. للتحقق من نتائجهم، كرروا التجربة مع نموذج GPT-5.6 Sol وإطار عمل Codex من OpenAI، ووجدوا أنماط فشل متطابقة تقريبًا. تتعارض الدراسة مع ادعاءات أنثروبيك (التي نشرت 'عندما يبني الذكاء الاصطناعي نفسه') و OpenAI (التي قالت إن GPT-5.6 Sol وفّر أسابيع في التدريب اللاحق). يلاحظ المؤلفون أن بطاقة النظام لا تذكر هذه المساهمة. خلصوا إلى أن النماذج الحدودية يمكنها التعامل مع الهندسة ولكنها تواجه صعوبة في أسئلة البحث المفتوحة التي تستغرق أسابيع. تنتقد الدراسة أيضًا عملية مراجعة الأقران، مستشهدة بورقة AI Scientist-v2 من Sakana AI التي قُبلت في ورشة عمل لكنها سُحبت لاحقًا بسبب أخطاء في الاستشهادات.
المصدر: The Decoder (DE) — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة