क्या स्व-होस्टेड LLM क्लाउड मॉडल से बेहतर प्रदर्शन कर सकता है? GLM, Claude और GPT की तुलना पर एक व्यावहारिक अध्ययन
Anthropic
OpenAI
सेलेक्टेल के एक फुल-स्टैक डेवलपर ने एजेंटिक विकास में स्व-होस्टेड ओपन-सोर्स GLM मॉडल की तुलना वाणिज्यिक Claude और GPT मॉडल से करते हुए अपने वास्तविक अनुभव साझा किए। उनका तर्क है कि आंतरिक संदर्भ तक पहुंच अक्सर मॉडल की कच्ची क्षमता से अधिक महत्वपूर्ण होती है, और वे दिखाते हैं कि सीधे रिपॉजिटरी एक्सेस के साथ GLM-5.1/5.2 ने एक वास्तविक एकीकरण कार्य में Claude को पीछे छोड़ दिया। समान संदर्भ वाले सिंथेटिक बेंचमार्क में, सभी मॉडलों ने कार्यों को संभाला, जिसमें Claude Opus 4.7 ने सबसे कम कोड समीक्षा निष्कर्ष दिखाए।
लेखक, जो Selectel में एक फुल-स्टैक डेवलपर हैं, यह मूल्यांकन करते हैं कि क्या सेल्फ-होस्टेड ओपन-सोर्स LLM एजेंटिक सॉफ्टवेयर विकास में व्यावसायिक मॉडलों के बराबर हो सकते हैं। वे तर्क देते हैं कि कॉर्पोरेट परियोजनाओं में, प्राथमिक निर्णय यह होता है कि मॉडल को कौन-सा संदर्भ दिया जा सकता है, और उसके बाद ही कौन-सा मॉडल उपयोग करना है। बंद आंतरिक रिपॉजिटरी के लिए, वे OpenCode के माध्यम से सेल्फ-होस्टेड GLM-5.1 और GLM-5.2 का उपयोग करते हैं, जबकि Claude और GPT जैसे बाहरी मॉडल सार्वजनिक या सैनिटाइज़ किए गए डेटा के लिए उपयोग किए जाते हैं। एक वास्तविक एकीकरण कार्य में, तीन आंतरिक रिपॉजिटरी तक सीधी पहुँच के साथ GLM-5.1 ने 1-2 घंटों में न्यूनतम इंजीनियर भागीदारी के साथ एक कार्यशील प्रूफ-ऑफ-कॉन्सेप्ट तैयार किया, जबकि Claude Opus 4.7 और Sonnet 4.6 को सीधी पहुँच की कमी के कारण दो घंटे से अधिक का मैनुअल संदर्भ तैयारी और तीन घंटे का एजेंट कार्य करना पड़ा। समान संदर्भ वाले सिंथेटिक बेंचमार्क में, GLM-5.1, Claude Opus 4.7, Claude Sonnet 4.6, और GPT-5.5 xhigh सभी ने एक पूर्ण कार्य चक्र पूरा किया; क्रॉस-रिव्यू में पाया गया कि Claude Opus 4.7 में सबसे कम (एक) गैर-महत्वपूर्ण मुद्दे थे, जबकि GLM-5.1 में चार मामूली खामियाँ थीं। लेखक ने निष्कर्ष निकाला कि एक अच्छी तरह से कॉन्फ़िगर किया गया हार्नेस और उचित संदर्भ पहुँच मॉडल चयन से अधिक महत्वपूर्ण है।
स्रोत: Habr — хаб ИИ —
मूल
