शोध 🇺🇸 13.08.2026 20:03

2,200 ICML पेपर्स को पुनः निर्मित करके हमने क्या सीखा

Hugging FaceHugging Face AnthropicAnthropic OpenAIOpenAI CursorCursor alphaXivalphaXiv
Hugging Face ने alphaXiv के साथ मिलकर ICML 2026 ओपन रिप्रोडक्शन्स चैलेंज चलाया, जिसमें प्रतिभागियों ने AI कोडिंग एजेंटों का उपयोग करके 2,200 पेपरों को पुनः निर्मित करने का प्रयास किया। परिणाम: जांचे गए पेपरों में से 51% में कम से कम एक दावा सत्यापित हुआ, 23% में एक दावा गलत या विवादित पाया गया, और 242 पेपरों में परस्पर विरोधी निर्णय थे। मानवीय निगरानी महत्वपूर्ण साबित हुई, क्योंकि एजेंटों ने सीमाएँ हिट कीं और गलत असत्यापन हुए; इस आयोजन को अब तक का सबसे बड़ा दावा-स्तरीय मशीन लर्निंग सम्मेलन ऑडिट माना जाता है।
Hugging Face और alphaXiv ने 15 जुलाई से 2 अगस्त 2026 तक ICML 2026 ओपन रिप्रोडक्शंस चैलेंज का आयोजन किया, जिसमें प्रतिभागियों को Claude Code, Codex, Cursor और Pi जैसे AI कोडिंग एजेंटों का उपयोग करके सम्मेलन के पेपरों को दोबारा तैयार करने के लिए आमंत्रित किया गया। प्रतिभागियों को $20 के कंप्यूट क्रेडिट मिले और उन्होंने 2,962 क्लाउड जॉब शुरू किए; जहां पूर्ण पुनरुत्पादन असंभव था, वहां सिंथेटिक डेटा पर खिलौना पुनरुत्पादन का उपयोग किया गया। जांचे गए 2,200 पेपरों में से, 1,103 (51%) में कम से कम एक दावा स्वतंत्र रूप से सत्यापित किया गया था, जिसमें 266 पूरी तरह से पुनरुत्पादित और 632 आंशिक रूप से पुनरुत्पादित थे, बिना किसी मिथ्याकरण के; 3,978 व्यक्तिगत दावों की पुष्टि हुई। हालांकि, 496 (23%) में कम से कम एक दावा मिथ्या या विवादित पाया गया, जिसमें 49 ऐसे थे जहां सभी दावे मिथ्या थे और 242 ऐसे थे जहां स्वतंत्र टीमों ने समान दावों पर विपरीत फैसले सुनाए। उल्लेखनीय पुष्ट मिथ्याकरण में एक पेजिंग पेपर का प्रमाण k=1024 के बाद विफल होना, एक प्रमेय का चरण 224 पर टूटना, एक सिद्धांत पेपर में रिवर्स KL का उपयोग करते हुए कोड में फॉरवर्ड KL का उपयोग, और EOS पैडिंग टोकन द्वारा मूल्यांकन को पतला करना शामिल है। आयोजकों ने सभी दावे किए गए मिथ्याकरण को फिर से सत्यापित किया और लेखकों से संपर्क किया, जिन्होंने सकारात्मक प्रतिक्रिया दी। चैलेंज ने यह भी उजागर किया कि एजेंट सीमाओं का सामना करते हैं, जैसे स्थानीय लूप्स और गलत व्याख्याएँ, और विश्वसनीय परिणामों के लिए मानवीय निगरानी आवश्यक थी, जैसा कि ह्यूमन-इन-द-लूप विजेता में देखा गया जिसने व्यक्तिगत रूप से छवि जोड़े का न्याय किया। यह आयोजन एक मशीन लर्निंग सम्मेलन का सबसे बड़ा खुला, दावा-दर-दावा ऑडिट माना जाता है, और सभी लॉगबुक, फैसले, ट्रेस और आर्टिफैक्ट सार्वजनिक हैं।
स्रोत: Hugging Face blog — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार