Modelo de IA pequeño 11 veces más barato que GPT-5.6 Luna y casi lo iguala en prueba de lógica
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Pathway Lab publicó los resultados de las pruebas de su modelo de razonamiento BDH-CQ, que tiene 150 millones de parámetros y obtuvo un 29,5% en el benchmark ARC-AGI-1. Su costo computacional fue de $0,0007 por tarea, 11 veces más barato que el GPT-5.6 Luna de OpenAI, que obtuvo un 34,2% a $0,008 por tarea. El laboratorio argumenta que las arquitecturas alternativas pueden mejorar drásticamente la eficiencia de costos.
Pathway Lab, que se centra en arquitecturas diferentes a los transformers, publicó resultados para su modelo de razonamiento BDH-CQ. A pesar de tener solo 150 millones de parámetros, el modelo alcanzó un 29,5% en el benchmark ARC-AGI-1, con un costo de solo 0,0007 dólares por tarea. Esto lo hace 11 veces más barato que el modelo pequeño de OpenAI, GPT-5.6 Luna, que obtuvo un 34,2% y costó 0,008 dólares por tarea incluso después de un recorte de precio del 80%. Para comparar, Anthropic Claude Opus 5 y Google Gemini 3.1 Pro obtuvieron puntuaciones del 97–98% en la misma prueba, pero costaron entre 0,5 y 0,6 dólares por tarea, casi mil veces más. Alibaba Qwen3 235B costó más del triple que BDH-CQ, pero rindió peor. El laboratorio dice que la diferencia proviene de los mecanismos de razonamiento: la mayoría de los modelos de IA actuales generan texto intermedio que consume tokens, mientras que BDH-CQ resuelve problemas en silencio en la memoria. Los experimentos iniciales mostraron que BDH-CQ sigue leyes de escalado estándar comparables a los modelos transformer de 1 a 600 mil millones de parámetros. Pathway planea abordar tareas más difíciles, incluyendo el razonamiento matemático, la prueba ARC-AGI-2 y, eventualmente, una evaluación completa de ARC-AGI-3, con la esperanza de que la ventaja de eficiencia se mantenga en problemas más grandes y complejos.
Fuente: 3DNews —
original
