AI-modelbenchmark voor 1C-ontwikkeling: bijgewerkte ranglijst v2
Anthropic
OpenAI
Moonshot AI
xAI
Cursor
DeepSeek
Alibaba/Qwen
MiniMax
Een bijgewerkte benchmark voor AI-modellen in 1C-ontwikkeling is uitgebracht, waarin modellen zoals Claude Opus 5, GPT 5.6 Sol en Kimi K3 worden vergeleken. De benchmark categoriseert taken en meet tokenverbruik, waarbij Opus 5 algemeen leidt maar GPT 5.6 Sol uitblinkt met MCP. De auteur geeft persoonlijke aanbevelingen voor modelselectie.
De benchmark voor AI-modellen in 1C-ontwikkeling is bijgewerkt naar versie 2, met modellen zoals Claude Opus 5, Claude Fable 5, GPT 5.6 Sol, Kimi K3, Claude Opus 4.8, Grok 4.5, Composer 2.5, GPT 5.5, DeepSeek v4, GLM 5.2, Qwen 3.8 Max, Claude Sonnet 5, Mimi 2.5 en MiniMax M2.7. Taken zijn verdeeld in categorieën zoals algoritmen, architectuur, platformmechanismen, prestaties, metadata-werk en formulierontwikkeling. De benchmark registreert verbruikte tokens (invoer + uitvoer) exclusief cache. Modellen zijn getest in hun eigen leveranciersomgevingen: Claude Code voor Claude, Codex voor GPT, Kimi Code voor Kimi, Cursor voor Grok en Composer. Ook is er een variant met MCP (Model Context Protocol) en vaardigheden/regels opgenomen. De benchmark is uitgevoerd door Hermes met GPT 5.6 Sol, met enkele correcties. Claude Opus 5 is de algemene leider, maar GPT 5.6 Sol presteert het best met MCP vanwege betere instructieopvolging. Kimi K3 is veelbelovend maar traag. DeepSeek v4 en GLM 5.2 zijn alleen voor budgetgebruik. Qwen 3.8, Sonnet 5, Mimi 2.5 en MiniMax M2.7 worden niet aanbevolen voor 1C-ontwikkeling. De persoonlijke stack van de auteur omvat Cursor met Claude Opus voor complexe taken, Grok/Composer voor dagelijks werk, en GPT 5.6 voor review en autonome agenten.
Bron: Habr — хаб ИИ —
origineel
