GPT-5.6 Luna от OpenAI, которая набрала 34,2% и стоила 0,008 доллара за задание даже после снижения цены на 80%. Для сравнения, модели Anthropic Claude Opus 5 и Google Gemini 3.1 Pro показали результат 97–98% в том же тесте, но стоили 0,5–0,6 доллара за задание, что почти в тысячу раз дороже. Alibaba Qwen3 235B стоила более чем в три раза дороже BDH-CQ, но показала худший результат. В лаборатории утверждают, что разница обусловлена механизмами рассуждений: большинство современных моделей ИИ генерируют промежуточный текст, который расходует токены, тогда как BDH-CQ решает задачи «молча», в памяти. Первоначальные эксперименты показали, что BDH-CQ следует стандартным законам масштабирования, сопоставимым с моделями-трансформерами с числом параметров от 1 до 600 миллиардов. Pathway планирует решать более сложные задачи, включая математические рассуждения, тест ARC-AGI-2 и, в конечном итоге, полную оценку ARC-AGI-3, надеясь, что преимущество в эффективности сохранится на более крупных и сложных задачах.