лучше отражает намерения пользователя. В материале объясняется, что нативная мультимодальность означает, что изображения и текст совместно формируют основную модель начиная с этапа предобучения и далее — на этапе постобучения и в контексте агентного восприятия. Kimi K3 возглавила рейтинг Arena Frontend Code с результатом 1679 баллов, а в тесте, проведённом Puter, модель безошибочно выявила все пять визуальных отклонений без единого ложного срабатывания. Статья противопоставляет этот подход стратегии DeepSeek, которая сосредоточена на текстовых моделях и внешних инструментах: несмотря на сильные показатели DeepSeek V4 в программировании и рассуждениях, у модели отсутствует нативное зрение. Другие китайские лаборатории, включая Alibaba и ByteDance, также следуют по пути нативной мультимодальности. В статье рассматриваются издержки такого подхода: интеграция зрения может ослаблять языковые, логические и программистские способности модели, требуя при этом больше вычислительных ресурсов и данных. K3 использует модель с 2,8 триллиона параметров, из которых 104 миллиарда активируются на каждый токен, а также собственный визуальный энкодер MoonViT-V2. Автор отмечает компромисс между вложениями в развитие навыков программирования здесь и сейчас и подготовкой к мультимодальному будущему, а также упоминает, что после выхода K3 охотники за талантами буквально осаждают окрестности офиса Moonshot AI.