Benchmark de Modelos de IA para Desenvolvimento 1C: Ranking Atualizado v2
Anthropic
OpenAI
Moonshot AI
xAI
Cursor
DeepSeek
Alibaba/Qwen
MiniMax
Um benchmark atualizado de modelos de IA para desenvolvimento 1C é apresentado. O teste envolve 14 modelos, incluindo Claude Opus 5, GPT 5.6 Sol, Kimi K3 e outros. O líder é reconhecido como Claude Opus 5, enquanto GPT 5.6 Sol tem melhor desempenho com MCP e instruções.
O autor do benchmark para desenvolvimento em 1C atualizou a classificação dos modelos, incluindo 14 modelos: Claude Opus 5, Claude Fable 5, GPT 5.6 Sol, Kimi K3, Claude Opus 4.8, Grok 4.5, Composer 2.5, GPT 5.5, DeepSeek v4, GLM 5.2, Qwen 3.8 Max, Claude Sonnet 5, Mimi 2.5 e MiniMax M2.7. Os testes foram realizados nos ambientes dos fornecedores (Claude Code, Codex, Kimi Code, Cursor, entre outros) com o máximo esforço de raciocínio (reasoning effort) e uma variante separada com servidores MCP para 1C. As tarefas são divididas em categorias: algoritmos, arquitetura, mecanismos da plataforma, desempenho, metadados e desenvolvimento de formulários. São considerados os tokens gastos sem cache. Pelos resultados, o Claude Opus 5 foi considerado o melhor para codificação, mas perde para o GPT 5.6 Sol em seguir instruções ao usar MCP. O Kimi K3 apresentou alto nível, mas velocidade lenta. DeepSeek v4 e GLM 5.2 são recomendados apenas em caso de economia rigorosa e com MCP. Qwen 3.8 Max, Claude Sonnet 5, Mimi 2.5 e MiniMax M2.7 não são recomendados para 1C. Os planos incluem adicionar medição de tempo, custo total e tarefas de melhoria de funcionalidades. O autor usa Cursor com Claude Opus para arquitetura, Grok/Composer para tarefas principais e GPT 5.6 Sol para revisão e agentes autônomos.
Fonte: Habr — хаб ИИ —
original
