العواملالأبحاث 🇩🇪 01.08.2026 17:02

تقرير ميداني من OpenAI: وكلاء الذكاء الاصطناعي يعيدون كتابة برامج بحثية هشة، لكن على الباحثين التحقق بدقة

OpenAIOpenAI AnthropicAnthropic
وجدت OpenAI وشركاء أكاديميون أن وكلاء البرمجة بالذكاء الاصطناعي يمكنهم تسريع وصيانة البرامج البحثية القديمة، لكن عبء العمل ينتقل من البرمجة إلى التحقق. في ثماني دراسات حالة، قام الوكلاء بتحديث الأدوات، بعضها يعمل أسرع بأكثر من 60 مرة، ومع ذلك غالباً ما يتصرفون بثقة أثناء إنتاج كود غير صحيح. يؤكد الباحثون على الحاجة إلى التحقق المستقل والإشراف العلمي.
تقرير ميداني من OpenAI وشركاء أكاديميين يوثق ثماني دراسات حالة، معظمها في علم الأحياء، حيث تم استخدام وكلاء برمجة مثل Codex وClaude Code لصيانة البرامج البحثية أو تحسينها أو إعادة كتابتها. تراوحت المشاريع من الصيانة البسيطة إلى إعادة الكتابة الكاملة بلغات حديثة. على سبيل المثال، قام GPT-5.5 بتحديث عملية البناء لمكتبة Python المسماة cyvcf2، بينما قام وكيلان، Claude Code وCodex، بترحيل حوالي 10,000 سطر من MHCflurry من TensorFlow إلى PyTorch. قام مشروع rustar-aligner بإعادة كتابة STAR، وهي أداة C/C++ تتكون من آلاف الأسطر، في Rust، محققًا توافقًا بنسبة 99.815% و99.883% مع الأصل في مجموعات الاختبار. قام RustQC، الذي ضم 15 أداة لمراقبة الجودة، بتخفيض وقت التشغيل من 15 ساعة و34 دقيقة إلى 14 دقيقة و54 ثانية، أي بمعامل يزيد عن 60. كان HelixForge، وهو بديل لـ BamSurgeon، أسرع بمقدار 59.6 مرة إجمالاً، مع كون الحساب الأساسي أسرع بمقدار 98.6 مرة. ومع ذلك، غالبًا ما بدا الوكلاء واثقين ولكنهم كانوا مخطئين؛ على سبيل المثال، في إعادة كتابة bayesm، احتوت إجراءان على أخطاء دقيقة، بما في ذلك معامل تحكم مقلوب وعامل تحجيم خاطئ. خلص الباحثون إلى أن البشر يجب أن يحددوا الأهداف ومعايير النجاح وطرق التحقق، بينما يتولى الوكلاء التنفيذ. يقدّر التقرير توفيرًا كبيرًا في الوقت، مثل صيانة NumPy التي يمكن أن توفر حوالي 650 ساعة سنويًا، لكنه يسلط الضوء على الصيانة طويلة الأجل والمسؤولية كتحديات رئيسية. تم دمج بعض التغييرات في المستودع الرئيسي، بينما رفض المؤلف الأصلي تغييرات أخرى مثل FastQC، مما أدى إلى دمج التحسينات في النسخة الأصلية بلغة Java بدلاً من ذلك. التقرير بأثر رجعي ويعتمد على التقارير الذاتية، ويشير إلى أن عنق الزجاجة يتحول من التنفيذ إلى التحقق والمراجعة العلمية. ينعكس هذا النمط في دراسة METR ودراسة حول إحباط فرق المطورين من كود الذكاء الاصطناعي. يتوافق التقرير مع استراتيجية OpenAI العلمية الأوسع، التي تشمل فريقًا مخصصًا بقيادة Kevin Weil وإصدار GPT-Rosalind.
المصدر: The Decoder (DE) — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة