मॉडल 🇷🇺 23.07.2026 23:47

GPT-5.6 और Kimi K3 ने कैसे सीखा अच्छा डिज़ाइन — Design Arena Research

OpenAIOpenAI Moonshot AIMoonshot AI AnthropicAnthropic
Design Arena के शोधकर्ताओं ने GPT-5.6 Sol और Kimi K3 का विश्लेषण किया ताकि यह समझा जा सके कि वे उच्च गुणवत्ता वाला डिज़ाइन कैसे प्राप्त करते हैं। Sol सामान्य AI डिज़ाइन पैटर्न को सक्रिय रूप से दबाता है, जबकि Kimi K3 अपनी तर्क श्रृंखला के भीतर एक AI एजेंट का अनुकरण करता है।
Design Arena, एक ब्लाइंड तुलना बेंचमार्क जिसमें इंसान AI-जनित वेबसाइटों पर वोट करते हैं, ने दो शीर्ष मॉडलों — GPT-5.6 Sol (OpenAI) और Kimi K3 (Moonshot AI) — के विश्लेषण जारी किए हैं। Sol ने Web Design (Non-Agentic) श्रेणी में 1353 का Elo स्कोर हासिल किया, जो इसके पूर्ववर्ती GPT-5.5 से 18 पायदान ऊपर है, और साथ ही इसने गति व लागत के मामले में नई Pareto सीमाएँ (Pareto frontiers, यानी सर्वश्रेष्ठ संभव संतुलन बिंदु) स्थापित कीं। शोधकर्ताओं ने पाया कि Sol ने AI-विशिष्ट खामियों (जैसे बैंगनी ग्रेडिएंट्स और बेंतो ग्रिड्स) को सिरे से बनाने से इनकार करके उन्हें दबाना सीख लिया, जिससे इसके डिज़ाइन स्पेस में मानो 'खाली जगहें' बन गईं। इसके विपरीत, GLM 5.2 इन खामियों से इसलिए बचता है क्योंकि उसने उन्हें सीखा ही नहीं है। वहीं Kimi K3 ने सिंगल-शॉट Frontend Arena में 1408 और 3D Design Arena में 1450 का Elo स्कोर हासिल करते हुए शीर्ष स्थान पाया। K3 अपनी तर्क-श्रृंखला (reasoning chain) के भीतर एक पूर्ण AI एजेंट का अनुकरण करता है, और अपने विचारों में अन्य Kimi मॉडलों की तुलना में 10 गुना अधिक कोड लिखता है, साथ ही यह एक सीखे हुए 'इंटरनेट इंडेक्स' का उपयोग करके Unsplash से असली इमेज आईडी याद रखता है, जिससे टूटे हुए लिंक की समस्या नहीं आती। हर मॉडल की रणनीति अलग है: GLM 5.2 अनजाने में खराब डिज़ाइन से बचता है, Sol सक्रिय रूप से उसे दबाता है, और K3 बार-बार मानसिक अनुकरण (iterative mental simulation) के ज़रिए इससे बचता है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार