GPT-5.6 Luna से 11 गुना सस्ता छोटा AI मॉडल, तर्क परीक्षण में लगभग बराबरी
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Pathway Lab ने अपने रीज़निंग मॉडल BDH-CQ के परीक्षण परिणाम प्रकाशित किए, जिसमें 150 मिलियन पैरामीटर हैं और ARC-AGI-1 बेंचमार्क पर 29.5% स्कोर किया। इसकी गणना लागत $0.0007 प्रति कार्य थी, जो OpenAI के GPT-5.6 Luna से 11 गुना सस्ती है, जिसने $0.008 प्रति कार्य पर 34.2% स्कोर किया। प्रयोगशाला का तर्क है कि वैकल्पिक आर्किटेक्चर लागत-दक्षता में भारी सुधार कर सकते हैं।
पाथवे लैब, जो ट्रांसफॉर्मर से अलग आर्किटेक्चर पर ध्यान केंद्रित करता है, ने अपने रीज़निंग मॉडल BDH-CQ के परिणाम जारी किए। केवल 150 मिलियन पैरामीटर होने के बावजूद, मॉडल ने ARC-AGI-1 बेंचमार्क पर 29.5% हासिल किया, जबकि प्रति कार्य लागत केवल $0.0007 रही। यह OpenAI के छोटे मॉडल GPT-5.6 Luna से 11 गुना सस्ता है, जिसने 34.2% स्कोर किया और 80% मूल्य कटौती के बाद भी प्रति कार्य $0.008 खर्च हुआ। तुलना के लिए, Anthropic Claude Opus 5 और Google Gemini 3.1 Pro ने उसी परीक्षण में 97–98% स्कोर किया, लेकिन प्रति कार्य लागत $0.5–$0.6 थी, जो लगभग एक हजार गुना अधिक है। Alibaba Qwen3 235B की लागत BDH-CQ से तीन गुना से अधिक थी, फिर भी प्रदर्शन खराब रहा। लैब का कहना है कि अंतर रीज़निंग तंत्र के कारण है: अधिकांश वर्तमान AI मॉडल मध्यवर्ती पाठ उत्पन्न करते हैं जो टोकन की खपत करता है, जबकि BDH-CQ समस्याओं को स्मृति में चुपचाप हल करता है। प्रारंभिक प्रयोगों से पता चला कि BDH-CQ 1 से 600 बिलियन पैरामीटर वाले ट्रांसफॉर्मर मॉडल के समान मानक स्केलिंग कानूनों का पालन करता है। पाथवे कठिन कार्यों, जिसमें गणितीय तर्क, ARC-AGI-2 परीक्षण और अंततः ARC-AGI-3 का पूर्ण मूल्यांकन शामिल है, से निपटने की योजना बना रहा है, उम्मीद है कि दक्षता लाभ बड़ी और अधिक जटिल समस्याओं पर बना रहेगा।
स्रोत: 3DNews —
मूल
