智能体模型 🇷🇺 10.08.2026 11:02

自托管大语言模型能否超越云端模型?GLM、Claude 和 GPT 的实际对比

AnthropicAnthropic OpenAIOpenAI
Selectel 的一位全栈开发者分享了自己在代理式开发中,将自托管开源 GLM 模型与商业 Claude 和 GPT 模型进行对比的真实经验。他们认为,访问内部上下文往往比模型本身的原始能力更重要,并展示了 GLM-5.1/5.2 在直接访问代码仓库的情况下,在实际集成任务中超越了 Claude。在上下文相同的合成基准测试中,所有模型都能处理任务,其中 Claude Opus 4.7 的代码审查发现最少。
作者是 Selectel 的全栈开发人员,评估了自托管的开源 LLM 在智能体软件开发中是否能与商业模型匹敌。他们认为,在企业项目中,首要决策是能给模型提供什么上下文,其次才是选择哪个模型。对于封闭的内部仓库,他们通过 OpenCode 使用自托管的 GLM-5.1 和 GLM-5.2,而 Claude 和 GPT 等外部模型则用于公共或脱敏数据。在一个真实的集成任务中,GLM-5.1 直接访问三个内部仓库,在 1 到 2 小时内生成了可工作的概念验证,且工程师参与最少,而 Claude Opus 4.7 和 Sonnet 4.6 由于缺乏直接访问,需要超过两小时的手动上下文准备和三个小时的智能体工作。在一个上下文相同的合成基准测试中,GLM-5.1、Claude Opus 4.7、Claude Sonnet 4.6 和 GPT-5.5 xhigh 都完成了完整的任务周期;交叉审查发现,Claude Opus 4.7 存在的问题最少(一个非关键问题),而 GLM-5.1 有四个小瑕疵。作者得出结论,配置良好的工具链和正确的上下文访问比模型选择更为关键。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻