ИсследованияМодели 🇷🇺 21.07.2026 02:03

Гибель богов: Fable и ещё 10 LLM реорганизуют код. Сравнение 11 моделей на задаче рефакторинга

AnthropicAnthropic OpenAIOpenAI DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen
Автор сравнил 11 языковых моделей (включая Fable-5, GPT-5.4, GPT-5.5, DeepSeek-4-pro и другие) на задаче реорганизации кода — распутывания «god node» из LangGraph-агента. Модели сначала генерировали предложения по рефакторингу, затем оценивали работы друг друга. Лучшие результаты показали Fable-5, GPT-5.4 и GPT-5.5.
В эксперименте использовался реальный LangGraph-агент, в котором одна нода plan содержала около 350 строк логики, объединяющей итерационные проверки, bootstrap-вопросы, подготовку схемы, вызов LLM, маршрутизацию и множество других функций — типичный антипаттерн «god node». Автор попросил 11 моделей (Fable-5, GPT-5.4, GPT-5.5, DeepSeek-4-pro, Gemini-3.1-pro, GLM-5.1, Kimi-2.6, MiMo-2.5-pro, Opus-4.7, Qwen-3.6-plus, Qwen-3.7-max) предложить архитектурные решения по вынесению логики на уровень графа. При этом модели не видели предложения друг друга на этапе генерации. Затем каждая модель оценивала все готовые предложения, не зная чужих оценок. Для анализа использовались три подхода: сходимость оценок, сравнение по тезисам и поиск медоида (центрального мнения). Fable-5, GPT-5.4 и GPT-5.5 показали наилучшие результаты, предложив сбалансированные, подробные и практически применимые архитектуры. Эксперимент показал, что LLM можно доверить не только генерацию кода, но и его реорганизацию, причём разные модели по-разному справляются с ролями генератора и оценщика.
Сокращения
LLM = Large Language Model — большая языковая модель
Источник: Habr — хаб NLP — оригинал

Наши прошлые публикации по теме

Есть свежие новости