Küçük Yapay Zeka Modeli, GPT-5.6 Luna'dan 11 Kat Daha Ucuz ve Mantık Testinde Neredeyse Ona Eşit
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Pathway Lab, 150 milyon parametreye sahip BDH-CQ adlı akıl yürütme modelinin test sonuçlarını yayınladı. Model, ARC-AGI-1 kıyaslamasında %29,5 puan aldı ve görev başına hesaplama maliyeti 0,0007 dolar oldu; bu, görev başına 0,008 dolar maliyetle %34,2 puan alan OpenAI'nin GPT-5.6 Luna modelinden 11 kat daha ucuzdur. Laboratuvar, alternatif mimarilerin maliyet verimliliğini önemli ölçüde artırabileceğini savunuyor.
Transformer mimarilerinden farklı mimarilere odaklanan Pathway Lab, akıl yürütme modeli BDH-CQ için sonuçlarını yayınladı. Yalnızca 150 milyon parametreye sahip olmasına rağmen model, ARC-AGI-1 kıyaslamasında %29,5 başarı elde ederken, görev başına maliyeti yalnızca 0,0007 dolar oldu. Bu, OpenAI'in küçük modeli GPT-5.6 Luna'dan 11 kat daha ucuz; Luna, %34,2 puan aldı ve %80 indirim yapılmasına rağmen görev başına 0,008 dolar maliyete sahipti. Karşılaştırma için, Anthropic Claude Opus 5 ve Google Gemini 3.1 Pro aynı testte %97-98 puan aldı ancak görev başına 0,5-0,6 dolar maliyetle neredeyse bin kat daha pahalıydı. Alibaba Qwen3 235B, BDH-CQ'dan üç kattan fazla maliyete sahipti ancak daha kötü performans gösterdi. Laboratuvar, farkın akıl yürütme mekanizmalarından kaynaklandığını söylüyor: günümüzdeki çoğu yapay zeka modeli, token tüketen ara metin üretirken, BDH-CQ sorunları bellek içinde sessizce çözüyor. İlk deneyler, BDH-CQ'nun 1 ila 600 milyar parametreli transformer modelleriyle karşılaştırılabilir standart ölçekleme yasalarını izlediğini gösterdi. Pathway, matematiksel akıl yürütme, ARC-AGI-2 testi ve nihayetinde ARC-AGI-3'ün tam değerlendirmesi dahil daha zorlu görevlerin üstesinden gelmeyi planlıyor ve verimlilik avantajının daha büyük ve daha karmaşık problemlerde de geçerli olacağını umuyor.
Kaynak: 3DNews —
orijinal
