Kimi K3 en PAC1 y ECOM1: resultados de 204 tareas y análisis de fallos
Moonshot AI
Moonshot AI publicó Kimi K3 como código abierto en julio. El modelo fue probado en dos benchmarks de BitGN (PAC1 y ECOM1) con 204 trazas abiertas. Los resultados muestran un buen rendimiento en recuperación simple y cálculos, pero fallos frecuentes en operaciones atómicas de múltiples archivos, comprobación de entradas no confiables y consistencia en tablas largas.
Moonshot AI publicó pesos abiertos para Kimi K3 el 27 de julio junto con un informe técnico. Para verificar el rendimiento de forma independiente, el modelo se ejecutó en dos conjuntos de tareas BitGN: PAC1 (documentos, facturas, bandeja de entrada, cambios en archivos por lotes) y ECOM1 (catálogo, inventario, carritos, pagos, devoluciones, logística). PAC1 obtuvo 61 sobre 104 (binario), ECOM1 44,75 sobre 100 (crédito parcial). Los 204 seguimientos abiertos permiten inspeccionar cada comando y cambio de estado. En PAC1, las tareas simples de búsqueda y aritmética lograron un 90-92% de éxito, pero surgieron tres modos clave de fallo: violación del esquema exacto (escribir nombres de campos similares pero incorrectos), operaciones por lotes no atómicas (cambios parciales de archivos antes de la validación completa del conjunto) y comprobaciones de entrada no confiable no bloqueantes (contenido peligroso detectado pero la acción aún ejecutada). En ECOM1, la búsqueda precisa de SKU y el proceso de pago estándar funcionaron bien, pero los modos de fallo incluyeron pérdida de estado entre filas en informes multilínea, activación excesiva de anomalías, falta de comprobaciones de identidad antes de leer datos privados y cambios de estado debido a entrada no confiable. Las tareas de optimización (programación de despacho) generaron planes factibles pero subóptimos. La comparación con otras ejecuciones públicas de BitGN muestra a Kimi K3 competitivo en tareas simples pero por detrás en restricciones complejas de múltiples pasos.
Fuente: Habr — хаб ИИ —
original
