Entre Kimi K3 et DeepSeek V4 : le décalage temporel de la multimodalité native
Moonshot AI
DeepSeek
OpenAI
Alibaba/Qwen
ByteDance
Tencent
Apple
L'article aborde l'importance stratégique des capacités multimodales natives dans les modèles d'intelligence artificielle, en prenant Kimi K3 comme étude de cas. Il souligne comment le retour visuel devient crucial pour les tâches d'agents, et oppose différentes approches parmi les laboratoires chinois d'IA concernant le moment et la manière d'intégrer la vision dans les grands modèles de langage.
Cet article de 36Kr explore comment les capacités multimodales natives creusent un écart concurrentiel entre des modèles comme Kimi K3 et DeepSeek V4. Un chercheur en multimodalité souligne que, pour les tâches à longue chaîne, le seul retour au niveau du code entraîne une accumulation d'erreurs, alors que le retour visuel est plus précis et plus proche de l'intention de l'utilisateur.
Le texte explique que la multimodalité native signifie que les images et le texte façonnent conjointement le modèle principal dès le pré-entraînement, en continuant à travers le post-entraînement et la perception par l'agent. Kimi K3 s'est hissé en tête du classement Arena Frontend Code avec 1679 points, et dans un test mené par Puter, il a identifié les cinq écarts visuels sans aucun faux positif.
L'article met cela en contraste avec l'approche de DeepSeek, qui privilégie les modèles purement textuels et des outils externes ; il note que, malgré les solides capacités de codage et de raisonnement de DeepSeek V4, ce dernier ne dispose pas de vision native. D'autres laboratoires chinois, comme Alibaba et ByteDance, suivent également la voie de la multimodalité native.
Le texte aborde ensuite les coûts associés : l'intégration de la vision peut diluer les capacités linguistiques, de raisonnement et de codage, tout en exigeant davantage de puissance de calcul et de données. K3 repose sur un modèle de 2 800 milliards de paramètres, avec 104 milliards de paramètres activés par jeton, ainsi qu'un encodeur visuel sur mesure, MoonViT-V2.
L'article relève enfin l'arbitrage entre investir dans le codage dès maintenant et se préparer aux futurs usages multimodaux, et mentionne que les chasseurs de talents affluent désormais autour de Moonshot AI depuis la sortie de K3.
Source: 36Kr —
original
