Modelo Tiny AI 11 vezes mais barato que GPT-5.6 Luna e quase iguala em teste de lógica
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Pathway Lab publicou resultados de teste para seu modelo de raciocínio BDH-CQ, que tem 150 milhões de parâmetros e obteve 29,5% no benchmark ARC-AGI-1. Seu custo computacional foi de $0,0007 por tarefa, 11 vezes mais barato que o GPT-5.6 Luna da OpenAI, que obteve 34,2% a $0,008 por tarefa. O laboratório argumenta que arquiteturas alternativas podem melhorar drasticamente a relação custo-eficiência.
A Pathway Lab, que se concentra em arquiteturas diferentes dos transformers, divulgou resultados para seu modelo de raciocínio BDH-CQ. Apesar de ter apenas 150 milhões de parâmetros, o modelo alcançou 29,5% no benchmark ARC-AGI-1, custando apenas US$ 0,0007 por tarefa. Isso o torna 11 vezes mais barato que o pequeno modelo da OpenAI, GPT-5.6 Luna, que obteve 34,2% e custou US$ 0,008 por tarefa, mesmo após um corte de preço de 80%. Para comparação, o Anthropic Claude Opus 5 e o Google Gemini 3.1 Pro pontuaram 97–98% no mesmo teste, mas custaram US$ 0,5–US$ 0,6 por tarefa, quase mil vezes mais. O Alibaba Qwen3 235B custou mais de três vezes mais que o BDH-CQ, mas teve desempenho inferior. O laboratório diz que a diferença vem dos mecanismos de raciocínio: a maioria dos modelos de IA atuais gera texto intermediário que consome tokens, enquanto o BDH-CQ resolve problemas silenciosamente na memória. Experimentos iniciais mostraram que o BDH-CQ segue leis de escala padrão comparáveis a modelos transformadores de 1 a 600 bilhões de parâmetros. A Pathway planeja atacar tarefas mais difíceis, incluindo raciocínio matemático, o teste ARC-AGI-2 e, eventualmente, uma avaliação completa do ARC-AGI-3, esperando que a vantagem de eficiência se mantenha em problemas maiores e mais complexos.
Fonte: 3DNews —
original
