النماذجالأبحاث 🇷🇺 23.07.2026 23:47

كيف تعلّمت GPT-5.6 وKimi K3 التصميم الجيد — بحث تصميم الأرينا

OpenAIOpenAI Moonshot AIMoonshot AI AnthropicAnthropic
قام باحثون من معيار تصميم الأرينا بتحليل كيفية تحقيق نموذجي GPT-5.6 Sol (من OpenAI) وKimi K3 (من Moonshot AI) لنتائج عالية في التصميم. حيث يقوم Sol بقمع الأنماط المضادة للذكاء الاصطناعي، بينما يحاكي K3 سلسلة التفكير الخاصة بالوكيل، ويحفظ معرفات الصور والمكتبات. الاستراتيجية الثالثة تأتي من GLM 5.2، الذي ببساطة لم يتعلم القوالب السيئة.
أصدر فريق معيار Design Arena تحليلاً لنموذجين يتصدران تصنيفات التصميم: GPT-5.6 Sol من OpenAI وKimi K3 من Moonshot AI. درس الباحثون كيفية تعلم النماذج "للذوق الرفيع" في التصميم، واكتشفوا أنه لا توجد وصفة عالمية. تمثل Design Arena مقارنات عمياء حيث يصوت الأشخاص لصالح الموقع الأكثر تفضيلاً من بين موقعين تم إنشاؤهما، مما يشكل تصنيف Elo. في السابق، تم تحديد مشكلة "التصميم النمطي للذكاء الاصطناعي" (التدرجات الأرجوانية، شبكات بينتو، الطباعة العملاقة)، والتي أُطلق عليها اسم "روائح التصميم"، وكان النموذج GPT-5.5 يعاني منها قبل ثلاثة أشهر. احتل GPT-5.6 Sol المركز الأول في ساحة تصميم الويب (غير القائم على العوامل) بتصنيف Elo بلغ 1353، متجاوزاً سابقه بـ 18 مركزاً، مع كونه الأسرع والأرخص بين النماذج ذات التصنيف المماثل. حلل الباحثون 1000 موقع تم إنشاؤها بواسطة Sol، واكتشفوا "فجوات" في فضاء التصاميم - مناطق يتجنبها النموذج رغم معرفته بها. أظهر تضمين التضمينات أن Sol تكبت عمداً الأنماط المضادة للذكاء الاصطناعي مثل التدرجات الأرجوانية وشبكات بينتو، لكنها لا تزال تُنتج قصاصات الورق (في 26.5% من الحالات) وتواجه صعوبة مع الرسوم البيانية الواقعية. التحليل الثاني خُصص لـ Kimi K3، الذي احتل المركز الأول في ساحة الواجهة الأمامية أحادية المحاولة بتصنيف Elo 1408 وفي ساحة التصميم ثلاثي الأبعاد بتصنيف Elo 1450. ينفق النموذج ما يقرب من 4 أضعاف عدد الرموز المميزة على التفكير مقارنة بسابقه، ويحاكي عمل وكيل ذكاء اصطناعي كامل في سلسلة التفكير: التخطيط، التصميم، التكرار، و"الاختبار الذهني". حفظ K3 عن ظهر قلب معرّفات الصور والمكتبات، مما جعل الأمثلة الاختبارية خالية من الصور المكسورة أو غير ذات الصلة، على عكس Claude Fable 5 وKimi K2.7 Code. وبالتالي، تتعايش ثلاث استراتيجيات في نفس المعيار: GLM 5.2 لم يتعلم السيئ (رخيص لكن نمطي)، Sol تعلمت وكبت (سريع ورخيص)، بينما K3 يكرر في ذهنه (يدفع ثمناً بالوقت والرموز المميزة).
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة