Cómo GPT-5.6 y Kimi K3 aprendieron buen diseño — Investigación de Design Arena
OpenAI
Moonshot AI
Anthropic
Investigadores del benchmark Design Arena analizaron cómo los modelos GPT-5.6 Sol (OpenAI) y Kimi K3 (Moonshot AI) lograron altos resultados en diseño. Sol suprime los antipatrones de IA, mientras que K3 imita la cadena de pensamiento de un agente, memorizando fotos e identificadores de bibliotecas. La tercera estrategia es la de GLM 5.2, que simplemente no aprendió plantillas malas.
Команда бенчмарка Design Arena выпустила разборы двух моделей, лидирующих в дизайн-рейтингах: GPT-5.6 Sol от OpenAI и Kimi K3 от Moonshot AI. Исследователи изучили, как модели научились «хорошему вкусу» в дизайне, и выяснили, что универсального рецепта нет. Design Arena представляет собой слепые сравнения, где люди голосуют за более понравившийся из двух сгенерированных сайтов, формируя Elo-рейтинг. Ранее была выявлена проблема «типичного ИИ-дизайна» (фиолетовые градиенты, bento-сетки, гигантская типографика), названная design smells, и три месяца назад ею страдала GPT-5.5. GPT-5.6 Sol заняла первое место на арене Web Design (Non-Agentic) с Elo 1353, обогнав предшественницу на 18 позиций, при этом став самой быстрой и дешевой среди моделей с сопоставимым рейтингом. Исследователи проанализировали 1000 сайтов, сгенерированных Sol, и обнаружили «дыры» в пространстве дизайнов — области, которые модель избегает, хотя знает их. Наложение эмбеддингов показало, что Sol целенаправленно подавляет ИИ-антипаттерны, такие как фиолетовые градиенты и bento-сетки, но все еще генерирует конфетти (26,5% случаев) и плохо справляется с реалистичными диаграммами. Второй разбор посвящен Kimi K3, занявшей первое место на single-shot Frontend Arena с Elo 1408 и на арене 3D-дизайна с Elo 1450. Модель тратит почти в 4 раза больше токенов на размышления, чем предшественница, и симулирует работу полноценного ИИ-агента в цепочке рассуждений: планирование, проектирование, итерации и «мысленное тестирование». K3 выучила ID фотографий и библиотек наизусть, благодаря чему на тестовых примерах не было битых или нерелевантных изображений, в отличие от Claude Fable 5 и Kimi K2.7 Code. Таким образом, на одном бенчмарке сосуществуют три стратегии: GLM 5.2 не выучила плохое (дешево, но шаблонно), Sol выучила и подавляет (быстрая и дешевая), а K3 итерирует в голове (платит временем и токенами).
Fuente: Habr — хаб ИИ —
original
