Kimi K3: 2,8 Trilhões de Parâmetros e uma Nova Visão do Benchmark 'Pelicano'
Moonshot AI
DeepSeek
Anthropic
OpenAI
Google/DeepMind
O laboratório chinês Moonshot AI lançou o modelo Kimi K3 com 2,8 trilhões de parâmetros, chamando-o de primeiro modelo "aberto classe 3T". O K3 supera o Claude Opus 4.8 max e o GPT-5.5 high, mas fica atrás do Claude Fable 5 e do GPT-5.6 Sol, com um custo de US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída, tornando-se o mais caro entre os modelos chineses. O autor também observa que o benchmark 'pelicano' está perdendo correlação com a qualidade do modelo, mas continua útil para avaliação rápida. O modelo já está disponível através do site e da API, com pesos abertos prometidos até 27 de julho.
A chinesa Moonshot AI anunciou o modelo Kimi K3, que chama de "o mais poderoso até hoje" — com 2,8 trilhões de parâmetros. A empresa posiciona-o como o primeiro modelo "aberto da classe 3T" (arredondando 2,8 para 3 trilhões), superando a DeepSeek com seu 1,6T v4 Pro. De acordo com seus próprios benchmarks, o K3 supera principalmente o Claude Opus 4.8 max e o GPT-5.5 high, mas fica atrás do Claude Fable 5 e do GPT-5.6 Sol. Segundo o relatório da Artificial Analysis, em sua avaliação privada de "conhecimento de longo prazo", o K3 obteve Elo 1547, 732 pontos a mais que o Kimi K2.6, ficando atrás apenas do Claude Fable 5. O custo por tarefa ($0,94) é próximo ao do GPT-5.6 Sol ($1,04), cerca de metade do Opus 4.8 ($1,80), mas superior ao de alternativas abertas. O uso de tokens do K3 caiu 21% em comparação com o K2.6. O modelo também lidera na arena Frontend Code da Arena.ai, superando até mesmo o Claude Fable 5. Os preços da API são de $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída — no nível da série Claude Sonnet da Anthropic, tornando o K3 o modelo mais caro entre os laboratórios de IA chineses. Isto representa um aumento significativo em relação ao Kimi K2.6 ($0,95/$4). Os 2,8 trilhões de parâmetros são mais que o dobro do modelo anterior de 1T. O autor testou o K3 via OpenRouter, gerando um SVG de um pelicano em uma bicicleta. A solicitação consumiu 95 tokens de entrada e 16.658 tokens de saída (dos quais 13.241 são tokens de raciocínio), com custo de 25 centavos. Ao reprocessar o SVG gerado, o modelo descreveu corretamente a imagem (por 0,6 centavos). O autor observa que o teste do "pelicano" perdeu correlação com a qualidade geral do modelo ao longo de 21 meses — atualmente, os melhores resultados são do GLM-5.2, embora ele não atinja a classe Fable. Ainda assim, o teste continua útil como "hello world": ele força a experimentar o modelo, fornece uma estimativa bruta de custo e tempo de raciocínio, verifica a compreensão básica de geometria e a capacidade de gerar SVG correto. Para o K3, o teste revelou que o modelo ainda usa apenas um nível de esforço de raciocínio ("max"), consome muitos tokens de raciocínio e também indicou um possível prompt de sistema oculto (85 tokens). A descrição visual do modelo é bastante de alta qualidade.
Fonte: Simon Willison —
original
