ModellenOnderzoek 🇷🇺 13.08.2026 22:02

Tiny AI-model 11 keer goedkoper dan GPT-5.6 Luna en bijna gelijkwaardig in logische test

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Pathway Lab publiceerde testresultaten voor zijn redeneermodel BDH-CQ, dat 150 miljoen parameters heeft en 29,5% scoorde op de ARC-AGI-1-benchmark. De rekenkosten bedroegen $0,0007 per taak, 11 keer goedkoper dan OpenAI's GPT-5.6 Luna, dat 34,2% scoorde voor $0,008 per taak. Het lab stelt dat alternatieve architecturen de kostenefficiëntie drastisch kunnen verbeteren.
Pathway Lab, dat zich richt op architecturen die verschillen van transformers, heeft resultaten vrijgegeven voor zijn redeneermodel BDH-CQ. Ondanks dat het model slechts 150 miljoen parameters heeft, behaalde het 29,5% op de ARC-AGI-1-benchmark, terwijl het slechts $0,0007 per taak kostte. Dat maakt het 11 keer goedkoper dan het kleine model GPT-5.6 Luna van OpenAI, dat 34,2% scoorde en $0,008 per taak kostte, zelfs na een prijsverlaging van 80%. Ter vergelijking: Anthropic Claude Opus 5 en Google Gemini 3.1 Pro scoorden 97–98% op dezelfde test, maar kostten $0,5–$0,6 per taak, bijna duizend keer meer. Alibaba Qwen3 235B kostte meer dan drie keer zoveel als BDH-CQ, maar presteerde slechter. Het lab zegt dat het verschil zit in de redeneermechanismen: de meeste huidige AI-modellen genereren tussenliggende tekst die tokens verbruikt, terwijl BDH-CQ problemen stil in het geheugen oplost. Eerste experimenten toonden aan dat BDH-CQ de standaard schaalwetten volgt die vergelijkbaar zijn met transformermodellen met 1 tot 600 miljard parameters. Pathway is van plan om moeilijkere taken aan te pakken, waaronder wiskundig redeneren, de ARC-AGI-2-test en uiteindelijk een volledige evaluatie van ARC-AGI-3, in de hoop dat het efficiëntievoordeel standhoudt bij grotere en complexere problemen.
Bron: 3DNews — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws