Moonshot AI libera pesos do popular Kimi-K3 — quase no nível dos líderes de mercado, mas muito mais simples de executar
Moonshot AI
OpenAI
Anthropic
A empresa chinesa Moonshot AI disponibilizou em código aberto os pesos do seu modelo Kimi-K3. Ele supera modelos anteriores da OpenAI e da Anthropic, custando de 2 a 3 vezes menos para operar, com taxas de acerto de cache de até 90% para tarefas de programação. O modelo usa formatos de precisão mista MXFP4 e MXFP8, e é otimizado para hardware menos potente, como a Nvidia H20.
A Moonshot AI disponibilizou gratuitamente os pesos de seu modelo Kimi-K3, permitindo que qualquer pessoa com poder computacional suficiente o execute localmente. O modelo supera significativamente as gerações anteriores dos modelos GPT da OpenAI e Claude da Anthropic, e fica apenas ligeiramente atrás dos modelos Sol e Fable mais recentes. O Kimi-K3 é de duas a três vezes mais barato de operar do que os equivalentes americanos e, com acertos de cache em tarefas de codificação, os custos caem para 0,30 dólares por milhão de tokens, em comparação com os 3 dólares do preço padrão de entrada. A eficiência provavelmente vem do uso de MXFP4 para armazenamento de pesos e MXFP8 para ativação, ambos formatos de baixa precisão que economizam memória. De seus 2,8 trilhões de parâmetros, apenas 104,2 bilhões estão ativos simultaneamente. O modelo foi projetado para rodar em aceleradores Nvidia H20, que carecem de suporte nativo para ponto flutuante MX, mas pode funcionar de forma ainda mais eficiente em chips Blackwell. O Kimi-K3 substitui o cache chave-valor por um manipulador de estado de tamanho fixo chamado Kimi Delta Attention, e utiliza MoE (Mixture of Experts) com apenas 16 dos 896 especialistas ativados. No entanto, apenas os pesos são abertos; o processo de treinamento e o conjunto de dados permanecem proprietários.
Fonte: 3DNews —
original
