PAC1 और ECOM1 पर Kimi K3: 204 कार्यों के परिणाम और विफलता विश्लेषण
Moonshot AI
Moonshot AI ने जुलाई में Kimi K3 को ओपन-सोर्स किया। मॉडल का परीक्षण दो BitGN बेंचमार्क (PAC1 और ECOM1) पर 204 ओपन ट्रेस के साथ किया गया। परिणाम सरल पुनर्प्राप्ति और गणना में मजबूत प्रदर्शन दिखाते हैं, लेकिन मल्टी-फ़ाइल एटॉमिक ऑपरेशन, अविश्वसनीय इनपुट जाँच और लॉन्ग-टेबल स्थिरता पर बार-बार विफलताएँ होती हैं।
Moonshot AI ने 27 जुलाई को Kimi K3 के खुले वज़न और एक तकनीकी रिपोर्ट प्रकाशित की। स्वतंत्र रूप से प्रदर्शन की पुष्टि करने के लिए, मॉडल को दो BitGN कार्य सेटों पर चलाया गया: PAC1 (दस्तावेज़, चालान, इनबॉक्स, बैच फ़ाइल बदलाव) और ECOM1 (कैटलॉग, इन्वेंट्री, कार्ट, भुगतान, रिटर्न, लॉजिस्टिक्स)। PAC1 में 104 में से 61 अंक (बाइनरी) और ECOM1 में 100 में से 44.75 अंक (आंशिक क्रेडिट) मिले। 204 खुले ट्रेस हर कमांड और स्टेट बदलाव का निरीक्षण करने की अनुमति देते हैं। PAC1 पर, सरल खोज और अंकगणितीय कार्यों में 90-92% सफलता मिली, लेकिन तीन प्रमुख विफलता मोड उभरे: सटीक स्कीमा का उल्लंघन (समान लेकिन गलत फ़ील्ड नाम लिखना), गैर-परमाणु बैच ऑपरेशन (पूर्ण सेट सत्यापन से पहले आंशिक फ़ाइल बदलाव), और गैर-अवरुद्ध अविश्वसनीय इनपुट जाँच (खतरनाक सामग्री का पता चला लेकिन कार्रवाई फिर भी निष्पादित हुई)। ECOM1 पर, सटीक SKU खोज और मानक चेकआउट ने अच्छा काम किया, लेकिन विफलता मोड में बहु-पंक्ति रिपोर्टों में पंक्तियों के बीच स्टेट का खो जाना, अत्यधिक विसंगति फ़्लैगिंग, निजी डेटा पढ़ने से पहले पहचान जाँच का अभाव, और अविश्वसनीय इनपुट के कारण स्टेट बदलाव शामिल थे। ऑप्टिमाइज़ेशन कार्य (डिस्पैच शेड्यूलिंग) ने संभव लेकिन उप-इष्टतम योजनाएँ दीं। अन्य सार्वजनिक BitGN रनों से तुलना से पता चलता है कि Kimi K3 सरल कार्यों में प्रतिस्पर्धी है लेकिन जटिल बहु-चरण बाधाओं में पीछे है।
स्रोत: Habr — хаб ИИ —
मूल
