1C 개발을 위한 AI 모델 벤치마크: 업데이트된 순위 v2
Anthropic
OpenAI
Moonshot AI
xAI
Cursor
DeepSeek
Alibaba/Qwen
MiniMax
1C 개발 분야에서 AI 모델에 대한 업데이트된 벤치마크가 공개되어 Claude Opus 5, GPT 5.6 Sol, Kimi K3 등의 모델을 비교합니다. 이 벤치마크는 작업을 분류하고 토큰 사용량을 측정하며, Opus 5가 전반적으로 선두를 달리고 있지만 GPT 5.6 Sol은 MCP와 함께 탁월한 성능을 보여줍니다. 저자는 모델 선택에 대한 개인적인 추천을 제공합니다.
1C 개발용 AI 모델 벤치마크가 버전 2로 업데이트되었으며, Claude Opus 5, Claude Fable 5, GPT 5.6 Sol, Kimi K3, Claude Opus 4.8, Grok 4.5, Composer 2.5, GPT 5.5, DeepSeek v4, GLM 5.2, Qwen 3.8 Max, Claude Sonnet 5, Mimi 2.5, MiniMax M2.7 등의 모델이 포함됩니다. 작업은 알고리즘, 아키텍처, 플랫폼 메커니즘, 성능, 메타데이터 작업, 폼 개발 등의 카테고리로 구분됩니다. 이 벤치마크는 캐시를 제외한 소비된 토큰(입력 + 출력)을 추적합니다. 모델은 공급업체 환경에서 테스트되었습니다: Claude 모델은 Claude Code, GPT는 Codex, Kimi는 Kimi Code, Grok과 Composer는 Cursor에서 테스트했습니다. MCP(모델 컨텍스트 프로토콜)와 스킬/규칙을 포함한 변형도 포함됩니다. 벤치마크는 Hermes가 GPT 5.6 Sol을 사용하여 일부 수정과 함께 실행했습니다. Claude Opus 5가 전체 선두이지만, GPT 5.6 Sol은 MCP 사용 시 더 나은 명령 추종 능력으로 최고입니다. Kimi K3는 유망하지만 느립니다. DeepSeek v4와 GLM 5.2는 예산용으로만 적합합니다. Qwen 3.8, Sonnet 5, Mimi 2.5, MiniMax M2.7은 1C 개발에 권장되지 않습니다. 저자의 개인 스택은 복잡한 작업에는 Cursor와 Claude Opus, 일상 작업에는 Grok/Composer, 리뷰 및 자율 에이전트에는 GPT 5.6을 포함합니다.
출처: Habr — хаб ИИ —
원문
