Como GPT-5.6 e Kimi K3 Aprenderam Bom Design — Pesquisa Design Arena
OpenAI
Moonshot AI
Anthropic
Pesquisadores do benchmark Design Arena analisaram como os modelos GPT-5.6 Sol (OpenAI) e Kimi K3 (Moonshot AI) alcançaram altos resultados em design. O Sol suprime antipadrões de inteligência artificial, enquanto o K3 imita a cadeia de pensamento de um agente, memorizando IDs de fotos e bibliotecas. A terceira estratégia é do GLM 5.2, que simplesmente não aprendeu modelos ruins.
Команда бенчмарка Design Arena выпустила разборы двух моделей, лидирующих в дизайн-рейтингах: GPT-5.6 Sol от OpenAI и Kimi K3 от Moonshot AI. Исследователи изучили, как модели научились «хорошему вкусу» в дизайне, и выяснили, что универсального рецепта нет. Design Arena представляет собой слепые сравнения, где люди голосуют за более понравившийся из двух сгенерированных сайтов, формируя Elo-рейтинг. Ранее была выявлена проблема «типичного ИИ-дизайна» (фиолетовые градиенты, bento-сетки, гигантская типографика), названная design smells, и три месяца назад ею страдала GPT-5.5. GPT-5.6 Sol заняла первое место на арене Web Design (Non-Agentic) с Elo 1353, обогнав предшественницу на 18 позиций, при этом став самой быстрой и дешевой среди моделей с сопоставимым рейтингом. Исследователи проанализировали 1000 сайтов, сгенерированных Sol, и обнаружили «дыры» в пространстве дизайнов — области, которые модель избегает, хотя знает их. Наложение эмбеддингов показало, что Sol целенаправленно подавляет ИИ-антипаттерны, такие как фиолетовые градиенты и bento-сетки, но все еще генерирует конфетти (26,5% случаев) и плохо справляется с реалистичными диаграммами. Второй разбор посвящен Kimi K3, занявшей первое место на single-shot Frontend Arena с Elo 1408 и на арене 3D-дизайна с Elo 1450. Модель тратит почти в 4 раза больше токенов на размышления, чем предшественница, и симулирует работу полноценного ИИ-агента в цепочке рассуждений: планирование, проектирование, итерации и «мысленное тестирование». K3 выучила ID фотографий и библиотек наизусть, благодаря чему на тестовых примерах не было битых или нерелевантных изображений, в отличие от Claude Fable 5 и Kimi K2.7 Code. Таким образом, на одном бенчмарке сосуществуют три стратегии: GLM 5.2 не выучила плохое (дешево, но шаблонно), Sol выучила и подавляет (быстрая и дешевая), а K3 итерирует в голове (платит временем и токенами).
Fonte: Habr — хаб ИИ —
original
