Kimi K3 e Unlimited OCR dominam rankings globais; modelos open-source chineses varrem exterior
Moonshot AI
Baidu
Modelos de inteligência artificial open-source chineses estão ganhando tração global. Em 27 de julho, a Moonshot AI publicou os pesos completos do Kimi K3, que rapidamente liderou a lista de tendências geral do Hugging Face, seguido pelo Unlimited OCR da Baidu. O Unlimited OCR também alcançou quatro primeiros lugares no GitHub e Hugging Face, e depois retornou ao topo da lista global de modelos do Hugging Face após um mês, impulsionado pela adoção sustentada por desenvolvedores.
Em 27 de julho, a Moonshot AI disponibilizou como código aberto os pesos completos do modelo Kimi K3, que rapidamente subiu ao topo da lista geral de tendências do Hugging Face em minutos. Imediatamente depois, o modelo Unlimited OCR da Baidu, que liderava a lista há dias, garantiu o segundo lugar. Esses dois modelos chineses de código aberto dominaram as classificações do Hugging Face, tornando-se um fenômeno. O Unlimited OCR alcançou um feito extraordinário: em cinco dias desde seu lançamento, acumulou mais de 10.000 estrelas no GitHub e liderou tanto a lista geral de tendências diárias do GitHub quanto a lista de Python, além das listas globais de modelos e de modelos multimodais do Hugging Face, conquistando um tetracampeonato. Um mês depois, o Unlimited OCR recuperou o primeiro lugar na lista global de tendências de modelos do Hugging Face após ser retuitado pelo vencedor do Prêmio Turing, Yann LeCun. Suas estrelas no GitHub ultrapassaram 19.700 e os downloads no Hugging Face chegaram a 2,65 milhões. A popularidade do Unlimited OCR decorre de seu avanço na análise de documentos longos. Modelos tradicionais de OCR lidam com documentos longos analisando página por página e concatenando os resultados, fazendo com que o Cache KV cresça durante a decodificação, aumentando a velocidade de inferência e os custos de memória. A Baidu propôs o mecanismo de Atenção de Janela Deslizante de Referência (Reference Sliding Window Attention, R-SWA), que mantém a atenção ao documento original enquanto retém apenas o conteúdo gerado mais recente como memória de trabalho, permitindo a análise contínua de dezenas de páginas em uma única passagem direta. Isso mantém o Cache KV constante, reduzindo o custo computacional e o uso de memória. Especialistas do setor observam que essa inovação não apenas acelera o OCR, mas também oferece novas abordagens para raciocínio de contexto longo e gerenciamento de memória. O interesse sustentado dos desenvolvedores no Unlimited OCR reflete que os modelos chineses de código aberto de inteligência artificial estão passando do entusiasmo inicial para a adoção contínua.
Fonte: QbitAI 量子位 —
original
