गिनती नहीं कर सकने वाली मशीनें, लेकिन संख्याओं का अनुमान लगाती हैं
OpenAI
Anthropic
Meta
Mistral
Google/DeepMind
भाषा मॉडल (एलएलएम) बिना किसी विशेष प्रशिक्षण के तालिका डेटा से संख्यात्मक मानों की भविष्यवाणी कर सकते हैं, और कभी-कभी विशेष प्रतिगमन उपकरणों से मेल खाते हैं या उन्हें पीछे छोड़ देते हैं। हालांकि, उनकी मूलभूत सीमाएँ हैं: वे संख्याओं को पाठ के रूप में मानते हैं, व्याख्या की कमी रखते हैं, और महंगे हैं। तालिकाओं पर केंद्रित नए विशेष मॉडल जैसे TabPFN शुद्ध संख्यात्मक तालिकाओं पर एलएलएम से बेहतर प्रदर्शन करते हैं।
यह लेख इस बात की पड़ताल करता है कि बड़े भाषा मॉडल (एलएलएम) संख्यात्मक मात्राओं का अनुमान कैसे लगा सकते हैं, इसके बावजूद कि वे वास्तव में संख्याओं को नहीं समझते हैं। एक्सजीबूस्ट जैसे पारंपरिक प्रतिगमन उपकरणों के विपरीत, जो निर्णय-वृक्ष दृष्टिकोण का उपयोग करते हैं, एलएलएम संख्याओं को वर्णों की श्रृंखला के रूप में संसाधित करते हैं, उन्हें मनमाने ढंग से टोकनों में विभाजित करते हैं। 2024 में एरिज़ोना विश्वविद्यालय और तकनीकी विश्वविद्यालय क्लुज-नापोका के शोधकर्ताओं द्वारा किए गए एक प्रयोग में, जीपीटी-4 और क्लाउड 3 जैसे एलएलएम को उदाहरणों की एक तालिका दी गई और एक लापता मान की भविष्यवाणी करने के लिए कहा गया। बिना किसी फाइन-ट्यूनिंग के, उन्होंने विशेष कार्यक्रमों के बराबर प्रदर्शन किया, और फ्रीडमैन #2 फ़ंक्शन पर, क्लाउड 3 ने ऐसे पांच उपकरणों को भी पीछे छोड़ दिया। दिलचस्प बात यह है कि उदाहरणों की संख्या बढ़ाने से सटीकता में सुधार हुआ, जिसे संयोग नहीं माना जा सकता। यह इन-कॉन्टेक्स्ट लर्निंग उल्लेखनीय है क्योंकि इसमें अतिरिक्त प्रशिक्षण की आवश्यकता नहीं होती है। हालाँकि, एलएलएम अविश्वसनीय हैं: उनकी भविष्यवाणियाँ पंक्तियों के क्रम और संख्याओं की परिशुद्धता के साथ बदलती रहती हैं, और उनकी कोई सीमा नहीं होती है, कभी-कभी वे बहुत गलत उत्तर देते हैं। प्रति भविष्यवाणी लागत के मामले में शास्त्रीय उपकरणों की तुलना में कई गुना अधिक महंगे होने के बावजूद, एलएलएम तब चमकते हैं जब डेटा कम होता है, उसमें टेक्स्ट होता है, या कॉलम के नाम अर्थपूर्ण होते हैं। टैबपीएफएन जैसे नए विशेष मॉडल, जो 2025 की शुरुआत में नेचर में प्रकाशित हुए, छोटे डेटा वाली शुद्ध संख्यात्मक तालिकाओं में एलएलएम से बेहतर प्रदर्शन करते हैं, तीन सेकंड से भी कम समय में उन शास्त्रीय विधियों के संयोजन को मात देते हैं जो चार घंटे तक चले। सिफारिश यह है कि एलएलएम का उपयोग केवल तभी किया जाए जब डेटा कम हो या सार्थक टेक्स्ट हो, और उन्हें शास्त्रीय उपकरणों के विकल्प के बजाय पूरक माना जाए।
स्रोत: Habr — хаб ИИ —
मूल
