ओपन सोर्सएजेंट 🇺🇸 01.08.2026 13:02

सुपाबेस ने इवाल्स को ओपन-सोर्स किया: वास्तविक कार्यों पर एआई कोडिंग एजेंटों का बेंचमार्क

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
सुपाबेस ने सुपाबेस इवाल्स को ओपन-सोर्स किया है, जो एक बेंचमार्क और फ्रेमवर्क है जो यह परीक्षण करता है कि एआई कोडिंग एजेंट सुपाबेस के साथ कितनी अच्छी तरह निर्माण करते हैं। यह क्लॉड कोड, कोडेक्स और ओपनकोड जैसे एजेंटों को वास्तविक कार्यों पर चलाता है, और निर्धारित जांच और एलएलएम-एज़-ए-जज के मिश्रण से परिणामों को स्कोर करता है। फ्रेमवर्क अपाचे-2.0 के तहत उपलब्ध है और एक सार्वजनिक लीडरबोर्ड को संचालित करता है।
सुप्राबेस ने सुप्राबेस इवल्स को ओपन-सोर्स किया है, जो एक बेंचमार्क और फ्रेमवर्क है जो यह परीक्षण करता है कि AI एजेंट सुप्राबेस का उपयोग करके कितनी अच्छी तरह निर्माण करते हैं। यह क्लॉड कोड, कोडेक्स और ओपनकोड जैसे कोडिंग एजेंटों को वास्तविक कार्यों जैसे स्कीमा बनाना, विफल एज फंक्शन को डिबग करना, या टूटी हुई RLS नीति को ठीक करना, पर चलाता है और फिर परिणाम को स्कोर करता है। यह बेंचमार्क supabase.com/evals पर एक सार्वजनिक लीडरबोर्ड और दैनिक निगरानी की जाने वाली आंतरिक रिग्रेशन सूट को संचालित करता है। फ्रेमवर्क Apache-2.0 के तहत उपलब्ध है और pnpm के माध्यम से स्थानीय रूप से चलता है। परिदृश्यों में उत्पादों (डेटाबेस, प्रमाणीकरण, स्टोरेज) और विषयों (आरएलएस, सुरक्षा) जैसे आयाम शामिल हैं, और प्रत्येक वास्तविक कंटेनरीकृत सुप्राबेस स्टैक के खिलाफ चलता है। स्कोरिंग निर्धारक जांच को एलएलएम-एज़-ए-जज के साथ जोड़ती है, और एजेंटों को एक पुनः प्रयास मिलता है। प्रमुख निष्कर्षों से पता चलता है कि ओपस 5 और किमी के3 जैसे शीर्ष मॉडलों ने बिना सहायता के 100% स्कोर किया, जबकि कौशल ने छोटे मॉडलों को अंतर को पाटने में मदद की। कमजोरियों में घोषणात्मक स्कीमा के बजाय हस्तलिखित माइग्रेशन, मैन्युअल प्रमाणीकरण सत्यापन, और एजेंटों के बीच असंगत डॉक्स उपयोग शामिल हैं।
स्रोत: MarkTechPost — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार