Kimi K3 et Unlimited OCR en tête des classements mondiaux, les modèles open-source chinois conquièrent l'étranger
Moonshot AI
Baidu
Les modèles open-source chinois d'IA gagnent en popularité à l'échelle mondiale. Le 27 juillet, Moonshot AI a ouvert l'intégralité des poids de Kimi K3, qui a rapidement grimpé en tête du classement général des tendances sur Hugging Face, suivi par Unlimited OCR de Baidu. Unlimited OCR a également obtenu quatre places de première sur GitHub et Hugging Face, et est ensuite revenu en tête du classement mondial des modèles tendance de Hugging Face après un mois, porté par une adoption continue des développeurs.
Le 27 juillet, Moonshot AI a open-sourcé les poids complets du modèle Kimi K3, qui a rapidement grimpé en tête du classement général des tendances de Hugging Face en quelques minutes. Immédiatement après, le modèle Unlimited OCR de Baidu, qui dominait le classement depuis plusieurs jours, a pris la deuxième place. Ces deux modèles open source chinois ont dominé les classements de Hugging Face, devenant un phénomène. Unlimited OCR a réalisé un exploit extraordinaire : en cinq jours après sa sortie, il a obtenu plus de 10 000 étoiles GitHub et a été en tête des classements généraux et Python de GitHub Daily Trending, ainsi que des classements mondiaux des modèles et des modèles multimodaux de Hugging Face, obtenant une quadruple première place. Un mois plus tard, Unlimited OCR a retrouvé la première place du classement mondial des tendances des modèles de Hugging Face après avoir été republié par le lauréat du prix Turing, Yann LeCun. Ses étoiles GitHub ont dépassé les 19 700 et les téléchargements sur Hugging Face ont atteint 2,65 millions. La popularité d'Unlimited OCR provient de sa percée dans l'analyse de longs documents. Les modèles OCR traditionnels traitent les longs documents en analysant page par page et en concaténant les résultats, ce qui fait croître le cache KV lors du décodage, augmentant la vitesse d'inférence et les coûts mémoire. Baidu a proposé le mécanisme d'attention à fenêtre glissante de référence (Reference Sliding Window Attention, R-SWA), qui maintient l'attention sur le document original tout en ne conservant que le contenu généré le plus récent comme mémoire de travail, permettant une analyse continue de dizaines de pages en un seul passage. Cela maintient le cache KV constant, réduisant le coût de calcul et l'utilisation mémoire. Les experts du secteur notent que cette innovation accélère non seulement l'OCR, mais offre également de nouvelles approches pour le raisonnement sur de longs contextes et la gestion de la mémoire. L'intérêt soutenu des développeurs pour Unlimited OCR reflète le fait que les modèles open source d'IA chinois passent de l'engouement initial à une adoption continue.
Source: QbitAI 量子位 —
original
