Model AI Mini 11 Kali Lebih Murah dari GPT-5.6 Luna dan Hampir Setara dalam Tes Logika
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Pathway Lab menerbitkan hasil uji untuk model penalarannya BDH-CQ, yang memiliki 150 juta parameter dan mencetak skor 29,5% pada tolok ukur ARC-AGI-1. Biaya komputasinya $0,0007 per tugas, 11 kali lebih murah daripada GPT-5.6 Luna milik OpenAI, yang mencetak 34,2% dengan biaya $0,008 per tugas. Lab tersebut berargumen bahwa arsitektur alternatif dapat secara drastis meningkatkan efisiensi biaya.
Pathway Lab, yang berfokus pada arsitektur yang berbeda dari transformer, merilis hasil untuk model penalarannya BDH-CQ. Meskipun hanya memiliki 150 juta parameter, model ini mencapai 29,5% pada tolok ukur ARC-AGI-1, dengan biaya hanya $0,0007 per tugas. Ini membuatnya 11 kali lebih murah daripada model kecil OpenAI GPT-5.6 Luna, yang mencetak 34,2% dan biaya $0,008 per tugas bahkan setelah pemotongan harga 80%. Sebagai perbandingan, Anthropic Claude Opus 5 dan Google Gemini 3.1 Pro mencetak 97–98% pada tes yang sama tetapi biaya $0,5–$0,6 per tugas, hampir seribu kali lebih mahal. Alibaba Qwen3 235B memakan biaya lebih dari tiga kali lipat dari BDH-CQ tetapi kinerjanya lebih buruk. Lab tersebut mengatakan perbedaannya berasal dari mekanisme penalaran: sebagian besar model AI saat ini menghasilkan teks perantara yang mengonsumsi token, sementara BDH-CQ memecahkan masalah secara diam-diam dalam memori. Eksperimen awal menunjukkan bahwa BDH-CQ mengikuti hukum penskalaan standar yang sebanding dengan model transformer dengan 1 hingga 600 miliar parameter. Pathway berencana untuk menangani tugas yang lebih sulit, termasuk penalaran matematis, tes ARC-AGI-2, dan akhirnya evaluasi penuh ARC-AGI-3, berharap keunggulan efisiensi tetap bertahan pada masalah yang lebih besar dan lebih kompleks.
Sumber: 3DNews —
asli
