Comment GPT-5.6 et Kimi K3 ont appris le bon design — Recherche Design Arena
OpenAI
Moonshot AI
Anthropic
Des chercheurs du benchmark Design Arena ont analysé comment les modèles GPT-5.6 Sol (OpenAI) et Kimi K3 (Moonshot AI) ont obtenu des résultats élevés en design. Sol supprime les anti-patrons de l'IA, tandis que K3 imite la chaîne de pensée d'un agent, mémorisant les identifiants de photos et de bibliothèques. La troisième stratégie provient de GLM 5.2, qui n'a tout simplement pas appris les mauvais modèles.
Команда бенчмарка Design Arena выпустила разборы двух моделей, лидирующих в дизайн-рейтингах: GPT-5.6 Sol от OpenAI и Kimi K3 от Moonshot AI. Исследователи изучили, как модели научились «хорошему вкусу» в дизайне, и выяснили, что универсального рецепта нет. Design Arena представляет собой слепые сравнения, где люди голосуют за более понравившийся из двух сгенерированных сайтов, формируя Elo-рейтинг. Ранее была выявлена проблема «типичного ИИ-дизайна» (фиолетовые градиенты, bento-сетки, гигантская типографика), названная design smells, и три месяца назад ею страдала GPT-5.5. GPT-5.6 Sol заняла первое место на арене Web Design (Non-Agentic) с Elo 1353, обогнав предшественницу на 18 позиций, при этом став самой быстрой и дешевой среди моделей с сопоставимым рейтингом. Исследователи проанализировали 1000 сайтов, сгенерированных Sol, и обнаружили «дыры» в пространстве дизайнов — области, которые модель избегает, хотя знает их. Наложение эмбеддингов показало, что Sol целенаправленно подавляет ИИ-антипаттерны, такие как фиолетовые градиенты и bento-сетки, но все еще генерирует конфетти (26,5% случаев) и плохо справляется с реалистичными диаграммами. Второй разбор посвящен Kimi K3, занявшей первое место на single-shot Frontend Arena с Elo 1408 и на арене 3D-дизайна с Elo 1450. Модель тратит почти в 4 раза больше токенов на размышления, чем предшественница, и симулирует работу полноценного ИИ-агента в цепочке рассуждений: планирование, проектирование, итерации и «мысленное тестирование». K3 выучила ID фотографий и библиотек наизусть, благодаря чему на тестовых примерах не было битых или нерелевантных изображений, в отличие от Claude Fable 5 и Kimi K2.7 Code. Таким образом, на одном бенчмарке сосуществуют три стратегии: GLM 5.2 не выучила плохое (дешево, но шаблонно), Sol выучила и подавляет (быстрая и дешевая), а K3 итерирует в голове (платит временем и токенами).
Source: Habr — хаб ИИ —
original
