Entre Kimi K3 y DeepSeek V4: La Brecha Temporal de la Multimodalidad Nativa
Moonshot AI
DeepSeek
OpenAI
Alibaba/Qwen
ByteDance
Tencent
Apple
El artículo analiza la importancia estratégica de las capacidades multimodales nativas en los modelos de inteligencia artificial, tomando como caso de estudio a Kimi K3. Destaca cómo la retroalimentación visual se está volviendo crucial para las tareas de agentes, y contrasta los diferentes enfoques entre los laboratorios de inteligencia artificial chinos sobre cuándo y cómo integrar la visión en los grandes modelos de lenguaje.
El artículo de 36Kr analiza cómo las capacidades multimodales nativas generan una brecha competitiva entre modelos como Kimi K3 y DeepSeek V4. Un investigador en multimodalidad señala que, en tareas de cadena larga, depender únicamente de la retroalimentación a nivel de código provoca acumulación de errores, mientras que la retroalimentación visual resulta más precisa y se ajusta mejor a la intención del usuario. El texto explica que la multimodalidad nativa implica que las imágenes y el texto configuran conjuntamente al modelo principal desde el preentrenamiento, continuando a lo largo del posentrenamiento y la percepción del agente. Kimi K3 se situó en el primer puesto de la clasificación Arena Frontend Code con 1679 puntos y, en una prueba realizada por Puter, identificó las cinco desviaciones visuales sin generar falsos positivos.
El artículo contrasta esto con el enfoque de DeepSeek, centrado en modelos exclusivamente de texto y en herramientas externas, señalando que, a pesar de las sólidas capacidades de codificación y razonamiento de DeepSeek V4, este carece de visión nativa. Otros laboratorios chinos, como Alibaba y ByteDance, también están siguiendo la vía de la multimodalidad nativa.
El texto aborda los costos asociados: integrar visión puede diluir las capacidades de lenguaje, razonamiento y codificación, además de requerir más cómputo y datos. K3 utiliza un modelo de 2,8 billones de parámetros, con 104 000 millones de parámetros activados por token, y un codificador de visión personalizado llamado MoonViT-V2. El artículo señala la disyuntiva entre invertir en codificación en el presente o prepararse para un futuro multimodal, y menciona que, tras el lanzamiento de K3, los cazatalentos se están congregando alrededor de Moonshot AI.
Fuente: 36Kr —
original
