Kimi K3 no PAC1 e ECOM1: resultados de 204 tarefas e análise de falhas
Moonshot AI
A Moonshot AI tornou o Kimi K3 open source em julho. O modelo foi testado em dois benchmarks BitGN (PAC1 e ECOM1) com 204 rastros abertos. Os resultados mostram desempenho forte em recuperação simples e cálculos, mas falhas frequentes em operações atômicas multiarquivo, verificação de entrada não confiável e consistência de tabelas longas.
Em 27 de julho, a Moonshot AI publicou pesos abertos para o Kimi K3, juntamente com um relatório técnico. Para verificar o desempenho de forma independente, o modelo foi executado em dois conjuntos de tarefas do BitGN: PAC1 (documentos, faturas, caixa de entrada, alterações em lote de arquivos) e ECOM1 (catálogo, inventário, carrinhos, pagamentos, devoluções, logística). O PAC1 obteve 61 de 104 (binário), e o ECOM1, 44,75 de 100 (crédito parcial). Os 204 traços abertos permitem inspecionar cada comando e mudança de estado. No PAC1, tarefas simples de busca e aritmética alcançaram 90-92% de sucesso, mas surgiram três modos principais de falha: violação de esquema exato (escrevendo nomes de campos semelhantes, mas incorretos), operações em lote não atômicas (alterações parciais de arquivos antes da validação completa do conjunto) e verificações de entrada não confiáveis não bloqueantes (conteúdo perigoso detectado, mas ação ainda executada). No ECOM1, a busca precisa por SKU e o checkout padrão funcionaram bem, mas os modos de falha incluíram perda de estado entre linhas em relatórios de múltiplas linhas, sinalização excessiva de anomalias, falta de verificações de identidade antes de ler dados privados e mudanças de estado devido a entrada não confiável. Tarefas de otimização (agendamento de despacho) produziram planos viáveis, mas abaixo do ideal. A comparação com outras execuções públicas do BitGN mostra que o Kimi K3 é competitivo em tarefas simples, mas fica atrás em restrições complexas de múltiplas etapas.
Fonte: Habr — хаб ИИ —
original
