1C开发AI模型基准测试:更新排名v2
Anthropic
OpenAI
Moonshot AI
xAI
Cursor
DeepSeek
Alibaba/Qwen
MiniMax
更新版1C开发AI模型基准测试发布,对比Claude Opus 5、GPT 5.6 Sol和Kimi K3等模型。基准测试对任务进行分类并衡量令牌使用量,Opus 5总体领先,但GPT 5.6 Sol在MCP方面表现出色。作者提供了模型选择的个人建议。
1C开发领域的AI模型基准测试已更新至第2版,涵盖Claude Opus 5、Claude Fable 5、GPT 5.6 Sol、Kimi K3、Claude Opus 4.8、Grok 4.5、Composer 2.5、GPT 5.5、DeepSeek v4、GLM 5.2、Qwen 3.8 Max、Claude Sonnet 5、Mimi 2.5以及MiniMax M2.7等模型。任务分为算法、架构、平台机制、性能、元数据工作和表单开发等类别。基准测试追踪了(输入加输出)所消耗的令牌数量,不包括缓存。模型在其供应商环境中进行了测试:Claude使用Claude Code,GPT使用Codex,Kimi使用Kimi Code,Grok和Composer使用Cursor。此外,还包含一个带有MCP及技能/规则的变体。该基准测试由Hermes使用GPT 5.6 Sol执行,并进行了一些修正。Claude Opus 5是整体领先者,但GPT 5.6 Sol在MCP下表现最佳,因为后者能更好地遵循指令。Kimi K3有潜力但速度较慢。DeepSeek v4和GLM 5.2仅适用于预算有限的场景。不推荐将Qwen 3.8、Sonnet 5、Mimi 2.5和MiniMax M2.7用于1C开发。作者的个人技术栈包括:使用带Claude Opus的Cursor处理复杂任务,日常工作中使用Grok/Composer,以及使用GPT 5.6进行审查和自主代理。
来源: Habr — хаб ИИ —
原文
