एजेंटशोध 🇷🇺 05.08.2026 09:02

स्वचालित शोध का युग: मैं सो गया और रात भर में 40 परिकल्पनाओं का परीक्षण हुआ — मुझे क्या करना चाहिए और आगे कैसे काम करना चाहिए?

Google/DeepMindGoogle/DeepMind OpenAIOpenAI DeepMindDeepMind AnthropicAnthropic
एक इंजीनियर बताता है कि कैसे उसने एक AI एजेंट के साथ परिकल्पना परीक्षण को स्वचालित किया, और रात भर में इसने 40 परिकल्पनाओं का परीक्षण किया। वह समाधान खोजने से लेकर ऐसी प्रणाली बनाने तक के बदलाव की व्याख्या करता है जो समाधान खोजती है, और संकल्प, करपाथी और DeepMind के उदाहरणों पर चर्चा करता है। वह हानि समानता और ओरेकल डिज़ाइन जैसी कमियों और मॉडल चयन के महत्व को भी शामिल करता है।
एक इंजीनियर बताता है कि कैसे, मैन्युअल रूप से परिकल्पनाओं का परीक्षण करने के बजाय, उसने परिकल्पना निर्माण पाइपलाइन का एक टेक्स्ट विवरण लिखा, प्रत्येक प्रयास का मूल्यांकन करने के लिए जेमिनी से कहा, और एक एजेंट को रात भर चलने दिया। सुबह, लॉग ने 40 परिकल्पनाओं का परीक्षण किया हुआ दिखाया। वह अपने शुरुआती भोले प्रयासों (बिना किसी योजना के दस एजेंटों को समानांतर चलाना) और अपने दूसरे प्रयास (एजेंटों को एक विस्तृत एजेंडा देना) की तुलना उस आलसी शाम के दृष्टिकोण से करता है जिसने काम किया। वह बताता है कि कुंजी एजेंटों पर बेहतर नियंत्रण नहीं थी, बल्कि यह थी कि परिणाम का मूल्यांकन कौन करता है। वह पूर्ववृत्तों का हवाला देता है: सनकल्प का क्यूआर अपघटन बैच क्यूआर पर 232 गुना गति प्राप्त करता है, करपाथी की 630-लाइन ऑटोरिसर्च स्क्रिप्ट ने रात भर सैकड़ों प्रयोग चलाए, और डीपमाइंड के अल्फाईवॉल्व ने 50 खुली गणित समस्याओं में से 20% के लिए समाधान में सुधार किया और गूगल के डेटासेंटर, चिप डिज़ाइन और एआई प्रशिक्षण को तेज किया। वह दो व्यक्तिगत मामले साझा करता है: पहले में, उसने डेटासेट फिल्टर हाथ से बनाने में दो सप्ताह बिताए, लेकिन वीएलएम के साथ एक जेमिनी-आधारित ओरेकल ने कुछ ही रनों में उसे हरा दिया; दूसरे में, उसे 30% प्रशिक्षण गति मिली लेकिन नुकसान उठाना पड़ा: वह हानि समानता जांच शामिल करना भूल गया (जिससे नैन हानि हुई), और एक अपर्याप्त विस्तृत ओरेकल ने कृत्रिम वस्तुओं को याद किया जैसे कि छवि-पाठ हटाने में बचे अक्षर। वह जोर देकर कहता है कि एक अच्छा ओरेकल और लूप बनाना ही वास्तविक काम है, और लूप के अंदर का मॉडल मायने रखता है। वह निष्कर्ष निकालता है कि विशेषज्ञता "समाधान खोजने" से "समाधान खोजने वाली प्रणाली बनाने" की ओर स्थानांतरित हो रही है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार