模型应用 🇷🇺 27.07.2026 05:02

AI模型在1C开发中的基准测试:更新排名v2

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI xAIxAI CursorCursor DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen MiniMaxMiniMax
针对1C开发的AI模型更新基准测试已发布。测试涉及14个模型,包括Claude Opus 5、GPT 5.6 Sol、Kimi K3等。Claude Opus 5被认为是领导者,而GPT 5.6 Sol在使用MCP和指令时表现最佳。
1С开发基准测试的作者更新了模型排行榜,纳入了14款模型:Claude Opus 5、Claude Fable 5、GPT 5.6 Sol、Kimi K3、Claude Opus 4.8、Grok 4.5、Composer 2.5、GPT 5.5、DeepSeek v4、GLM 5.2、Qwen 3.8 Max、Claude Sonnet 5、Mimi 2.5和MiniMax M2.7。测试在厂商提供的环境(如Claude Code、Codex、Kimi Code、Cursor等)中进行,采用最大推理努力,并设置了带1C MCP服务器的独立测试方案。任务分为算法、架构、平台机制、性能、元数据和表单开发等类别。考虑了无缓存的token消耗。结果显示,Claude Opus 5在编码方面表现最佳,但在使用MCP时指令遵循能力不如GPT 5.6 Sol。Kimi K3水平较高但速度较慢。DeepSeek v4和GLM 5.2仅在严格控制预算且搭配MCP时推荐。Qwen 3.8 Max、Claude Sonnet 5、Mimi 2.5和MiniMax M2.7不推荐用于1C开发。未来计划增加时间测量、总成本计算以及功能改进类任务。作者目前使用Cursor搭配Claude Opus处理架构问题,Grok/Composer处理主要任务,GPT 5.6 Sol用于代码审查和自主代理。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻