عصر البحث الذاتي: ذهبت للنوم وتم اختبار 40 فرضية بين عشية وضحاها — ماذا أفعل وكيف أعمل بعد ذلك؟
Google/DeepMind
OpenAI
DeepMind
Anthropic
يصف مهندس كيف قام بأتمتة اختبار الفرضيات باستخدام وكيل ذكاء اصطناعي، وفي ليلة واحدة تم اختبار 40 فرضية. وهو يشرح التحول من إيجاد الحلول إلى بناء أنظمة تجد الحلول، ويناقش أمثلة من sankalp وKarpathy وDeepMind. كما يتناول مخاطر مثل تكافؤ الخسارة وتصميم oracle، وأهمية اختيار النموذج.
يصف مهندس كيف أنه، بدلاً من اختبار الفرضيات يدويًا، كتب وصفًا نصيًا لخط أنابيب توليد الفرضيات، وطلب من جيميني تقييم كل محاولة، وترك وكيلًا يعمل طوال الليل. في الصباح، أظهر السجل اختبار 40 فرضية. ويقارن محاولاته المبكرة الساذجة (تشغيل عشرة وكلاء بالتوازي دون خطة) ومحاولته الثانية (إعطاء الوكلاء جدول أعمال مفصل) مع النهج الكسول المسائي الذي نجح. ويوضح أن المفتاح لم يكن تحكمًا أفضل في الوكلاء بل من يقيم النتيجة. ويستشهد بسوابق: تحقيق sankalp لتحلل QR تسريعًا بمقدار 232 ضعفًا على QR المجمّع، ونص Karpathy المؤلف من 630 سطرًا لإجراء أبحاث ذاتية تشغيل مئات التجارب بين عشية وضحاها، وتحسين AlphaEvolve من DeepMind حلولًا لـ 20% من 50 مسألة رياضية مفتوحة وتسريع مراكز بيانات Google وتصميم الرقائق وتدريب الذكاء الاصطناعي. ويشارك حالتين شخصيتين: في الأولى، قضى أسبوعين في صياغة عوامل تصفية لمجموعة البيانات يدويًا، لكن أوراكل قائم على جيميني مع نموذج رؤية لغوي تغلب على ذلك في بضع جولات؛ وفي الثانية، حقق تسريعًا في التدريب بنسبة 30% لكنه واجه مطبات: نسي تضمين فحص تكافؤ الخسارة (مما أدى إلى خسارة نان)، وأوراكل غير مفصل بشكل كافٍ أغفل قطعًا أثرية مثل الحروف المتبقية في إزالة نص الصورة. ويؤكد أن بناء أوراكل وحلقة جيدة هو العمل الحقيقي، وأن النموذج داخل الحلقة مهم. ويخلص إلى أن الخبرة تنتقل من "إيجاد حل" إلى "بناء نظام يجد حلولًا".
المصدر: Habr — хаб ИИ —
الأصلي
