Benchmark van AI-modellen voor 1C-ontwikkeling: Bijgewerkte ranglijst v2
Anthropic
OpenAI
Moonshot AI
xAI
Cursor
DeepSeek
Alibaba/Qwen
MiniMax
Er wordt een bijgewerkte benchmark van AI-modellen voor 1C-ontwikkeling gepresenteerd. De test omvat 14 modellen, waaronder Claude Opus 5, GPT 5.6 Sol, Kimi K3 en anderen. De leider is Claude Opus 5, terwijl GPT 5.6 Sol het beste presteert met MCP en instructies.
De auteur van een benchmark voor ontwikkeling in 1C heeft de modelranglijst bijgewerkt met 14 modellen: Claude Opus 5, Claude Fable 5, GPT 5.6 Sol, Kimi K3, Claude Opus 4.8, Grok 4.5, Composer 2.5, GPT 5.5, DeepSeek v4, GLM 5.2, Qwen 3.8 Max, Claude Sonnet 5, Mimi 2.5 en MiniMax M2.7. De tests zijn uitgevoerd in de omgevingen van de leveranciers (Claude Code, Codex, Kimi Code, Cursor en andere) met maximale redeneerinspanning en een aparte variant met MCP-servers voor 1C. De taken zijn verdeeld in categorieën: algoritmen, architectuur, platformmechanismen, prestaties, metadata en formulierontwikkeling. Er wordt rekening gehouden met verbruikte tokens zonder cache. Volgens de resultaten wordt Claude Opus 5 beschouwd als de beste voor codering, maar hij staat achter op GPT 5.6 Sol wat betreft het volgen van instructies bij gebruik van MCP. Kimi K3 liet een hoog niveau zien, maar een trage snelheid. DeepSeek v4 en GLM 5.2 worden alleen aanbevolen bij strikte besparingen en met MCP. Qwen 3.8 Max, Claude Sonnet 5, Mimi 2.5 en MiniMax M2.7 worden niet aanbevolen voor 1C. De planning omvat het toevoegen van tijdmetingen, volledige kosten en taken voor het aanpassen van functionaliteit. De auteur gebruikt Cursor met Claude Opus voor architectuur, Grok/Composer voor hoofdtaken en GPT 5.6 Sol voor reviews en autonome agenten.
Bron: Habr — хаб ИИ —
origineel
