模型智能体 🇨🇳 04.08.2026 10:02

Kimi K3 与 DeepSeek V4 之间:原生多模态的时间差

Moonshot AIMoonshot AI DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen ByteDanceByteDance TencentTencent AppleApple
文章讨论了 AI 模型中原生多模态能力的战略重要性,以 Kimi K3 为例。文章强调视觉反馈对于智能体任务正变得越来越关键,并对比了中国 AI 实验室在何时以及如何将视觉集成到大语言模型中的不同方法。
36氪的这篇文章讨论了原生多模态能力如何在Kimi K3与DeepSeek V4等模型之间制造出竞争差距。一位多模态研究者指出,在长链任务中,仅靠代码级反馈会导致错误累积,而视觉反馈更为精准,也更贴近用户意图。文章解释道,原生多模态意味着图像和文本从预训练阶段起就共同塑造主模型,并贯穿后训练及智能体感知过程。Kimi K3在Arena前端编码排行榜上以1679分位居榜首,并且在Puter的一项测试中,它准确识别了全部五处视觉偏差,没有出现误报。文章将这一成绩与DeepSeek的做法进行了对比,后者专注于纯文本模型和外部工具,并指出尽管DeepSeek V4在编码和推理方面表现出色,但它缺乏原生视觉能力。阿里、字节跳动等其他中国实验室也在走原生多模态的技术路线。文章讨论了成本问题:整合视觉能力可能会稀释语言、推理和编码能力,因此需要更多的算力和数据。K3采用了一个2.8万亿参数的模型,每个token激活1040亿参数,并配备了自研的视觉编码器MoonViT-V2。文章还指出了当下投资编码能力与为多模态未来做准备之间的权衡,并提到K3发布后,各家猎头纷纷涌向月之暗面公司附近。
来源: 36Kr — 原文
我们之前关于此话题的帖子 ↓
最新新闻