ModelsResearch 🇷🇺 23.07.2026 23:47

How GPT-5.6 and Kimi K3 Learned Good Design — Design Arena Research

OpenAIOpenAI Moonshot AIMoonshot AI AnthropicAnthropic
Researchers from the Design Arena benchmark analyzed how models GPT-5.6 Sol (OpenAI) and Kimi K3 (Moonshot AI) achieved high results in design. Sol suppresses AI anti-patterns, while K3 mimics an agent's chain-of-thought, memorizing photo and library IDs. The third strategy is from GLM 5.2, which simply did not learn bad templates.
Команда бенчмарка Design Arena выпустила разборы двух моделей, лидирующих в дизайн-рейтингах: GPT-5.6 Sol от OpenAI и Kimi K3 от Moonshot AI. Исследователи изучили, как модели научились «хорошему вкусу» в дизайне, и выяснили, что универсального рецепта нет. Design Arena представляет собой слепые сравнения, где люди голосуют за более понравившийся из двух сгенерированных сайтов, формируя Elo-рейтинг. Ранее была выявлена проблема «типичного ИИ-дизайна» (фиолетовые градиенты, bento-сетки, гигантская типографика), названная design smells, и три месяца назад ею страдала GPT-5.5. GPT-5.6 Sol заняла первое место на арене Web Design (Non-Agentic) с Elo 1353, обогнав предшественницу на 18 позиций, при этом став самой быстрой и дешевой среди моделей с сопоставимым рейтингом. Исследователи проанализировали 1000 сайтов, сгенерированных Sol, и обнаружили «дыры» в пространстве дизайнов — области, которые модель избегает, хотя знает их. Наложение эмбеддингов показало, что Sol целенаправленно подавляет ИИ-антипаттерны, такие как фиолетовые градиенты и bento-сетки, но все еще генерирует конфетти (26,5% случаев) и плохо справляется с реалистичными диаграммами. Второй разбор посвящен Kimi K3, занявшей первое место на single-shot Frontend Arena с Elo 1408 и на арене 3D-дизайна с Elo 1450. Модель тратит почти в 4 раза больше токенов на размышления, чем предшественница, и симулирует работу полноценного ИИ-агента в цепочке рассуждений: планирование, проектирование, итерации и «мысленное тестирование». K3 выучила ID фотографий и библиотек наизусть, благодаря чему на тестовых примерах не было битых или нерелевантных изображений, в отличие от Claude Fable 5 и Kimi K2.7 Code. Таким образом, на одном бенчмарке сосуществуют три стратегии: GLM 5.2 не выучила плохое (дешево, но шаблонно), Sol выучила и подавляет (быстрая и дешевая), а K3 итерирует в голове (платит временем и токенами).
Source: Habr — хаб ИИ — original
Our earlier posts on this topic ↓
Fresh news