क्लॉड फेबल 5 ने स्क्रैच से कोड रीराइटिंग में GPT-5.6 को पीछे छोड़ा। यहाँ कारण है
Anthropic
OpenAI
एपॉक एआई के मिररकोड बेंचमार्क में क्लॉड फेबल 5 ने 64% कार्य हल किए, जबकि GPT-5.6 सोल ने केवल 20%। यह अंतर कच्ची क्षमता से नहीं, बल्कि विश्वसनीयता से आता है: सोल अक्सर कार्यों को आंशिक रूप से हल करता है, जबकि फेबल लगातार उन्हें पूरा करता है। एडा (एक ऐसी भाषा जिसमें प्रशिक्षण डेटा दुर्लभ है) में फेबल का मजबूत प्रदर्शन याददाश्त के बजाय कौशल का संकेत देता है।
Epoch AI ने अपने MirrorCode लीडरबोर्ड को अपडेट किया है, जिससे पता चला है कि Anthropic का Claude Fable 5 ने 64% कार्य हल किए, जबकि OpenAI का GPT-5.6 Sol केवल 20% ही कर सका। यह तीन गुना अंतर असंगत लगता है क्योंकि मॉडल अन्य परीक्षणों में समान प्रदर्शन करते हैं, लेकिन Epoch AI और Anthropic ने कोई आधिकारिक स्पष्टीकरण नहीं दिया। METR के साथ विकसित MirrorCode के लिए मॉडलों को पूरे प्रोग्राम को शुरू से फिर से लिखना होता है, जिसमें केवल एक निष्पादन योग्य 'ब्लैक बॉक्स' (जिसके अंदर की कार्यप्रणाली दिखाई नहीं देती), दस्तावेज़ीकरण और दृश्य परीक्षण देखे जा सकते हैं; समाधानों को सभी छिपे हुए परीक्षणों को पास करना होता है। बेंचमार्क में sed और Ruff जैसे 15 वास्तविक प्रोग्राम शामिल हैं, जिनमें से प्रत्येक को दो भाषाओं में लागू किया गया है, जिसमें प्रति प्रयास 10 बिलियन टोकन और 7 दिनों का बजट है। हीटमैप का विश्लेषण करने पर पता चलता है कि Sol अक्सर आंशिक रूप से कार्य हल करता है (सफलता दर 50%, 33%, 17%), जबकि Fable लगभग हमेशा उन्हें पूरा करता है (100%, 83%)। एक और सुराग: Fable का प्रदर्शन Ada पर केवल थोड़ा गिरता है (Go पर 64% बनाम 61%), जबकि OpenAI मॉडल Ada पर काफी प्रभावित होते हैं — Sol 24% से गिरकर 19% हो जाता है, GPT-5.4 21% से 12% और GPT-5.5 17% से 5%। चूंकि प्रशिक्षण डेटा में इन प्रोग्रामों के Ada संस्करण लगभग नहीं हैं, Fable की Ada पर मजबूती वास्तविक कौशल (याद रखने के बजाय) को इंगित करती है। हालांकि, Epoch के अपने संदूषण जांच में 25 प्रोग्रामों में से 17 में याद रखने के संकेत मिले, और बेंचमार्क की सटीक-विनिर्देश सेटिंग वास्तविक दुनिया के विकास से भिन्न है।
स्रोत: Habr — хаб ИИ —
मूल
