साइकिल पर पेलिकन: एआई प्रयोगशालाओं की एक बड़े पैमाने पर जांच
OpenAI
Anthropic
Google/DeepMind
xAI
Alibaba/Qwen
DeepSeek
डेवलपर डायलन कैस्टिलो ने यह जांचने के लिए एक अध्ययन किया कि क्या एआई मॉडलों को साइकिल पर पेलिकन बनाने के लिए प्रशिक्षित किया जाता है। उन्होंने 7 मॉडलों पर 48 प्रॉम्प्ट का परीक्षण किया और ऐसे प्रशिक्षण का कोई सबूत नहीं पाया।
डायलन कैस्टिलो ने इस आम परिकल्पना की गहन जांच की कि AI प्रयोगशालाएं जानबूझकर मॉडलों को साइकिल पर पेलिकन बनाने के लिए प्रशिक्षित करती हैं। उन्होंने 8 प्रकार के जानवरों और 6 प्रकार के वाहनों को मिलाकर 48 प्रॉम्प्ट तैयार किए, और प्रत्येक को 7 मॉडलों - GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 और DeepSeek V4 Pro - पर तीन बार चलाया। मूल्यांकन के लिए GPT-5.6 Luna और Gemini 3.1 Flash-Lite का उपयोग किया गया। अध्ययन में इस बात का कोई सबूत नहीं मिला कि साइकिल पर पेलिकन की छवियां अन्य संयोजनों से बेहतर दिखती थीं। किसी भी प्रयोगशाला ने पेलिकन या साइकिल को अलग-अलग प्रस्तुत करने में अपेक्षाओं को पार नहीं किया, और 'पेलिकन-साइकिल' संयोजन में याद करने का कोई संकेत नहीं मिला। GLM-5.2 मॉडल ने इस विशिष्ट जोड़ी के लिए थोड़ा सुधार दिखाया, लेकिन यह प्रभाव सांख्यिकीय रूप से महत्वहीन माना गया।
स्रोत: Simon Willison —
मूल
