النماذجالعوامل 🇷🇺 28.07.2026 07:03

كيميكاي 3 على PAC1 وECOM1: نتائج 204 مهمة وتحليل الفشل

Moonshot AIMoonshot AI
شركة Moonshot AI أتاحت نموذج Kimi K3 مفتوح المصدر في يوليو. تم اختبار النموذج على معيارين من BitGN (PAC1 وECOM1) باستخدام 204 أثرًا مفتوحًا. أظهرت النتائج أداءً قويًا في الاسترجاع البسيط والحسابات ولكن مع إخفاقات متكررة في عمليات الذرة متعددة الملفات، والتحقق من المدخلات غير الموثوقة، واتساق الجداول الطويلة.
في 27 يوليو، نشرت Moonshot AI أوزانًا مفتوحة لنموذج Kimi K3 إلى جانب تقرير فني. للتحقق المستقل من الأداء، تم تشغيل النموذج على مجموعتي مهام من BitGN: PAC1 (المستندات والفواتير وصندوق الوارد وتغييرات الملفات الدفعية) وECOM1 (الكتالوج والمخزون وعربات التسوق والمدفوعات والمرتجعات والخدمات اللوجستية). سجل PAC1 61 من أصل 104 (ثنائي)، بينما سجل ECOM1 44.75 من أصل 100 (درجات جزئية). تسمح السجلات المفتوحة البالغ عددها 204 بفحص كل أمر وتغيير حالة. في PAC1، حققت مهام البحث البسيط والحساب نجاحًا بنسبة 90-92%، لكن ظهرت ثلاثة أنماط فشل رئيسية: انتهاك المخطط الدقيق (كتابة أسماء حقول مشابهة ولكن خاطئة)، والعمليات الدفعية غير الذرية (تغييرات جزئية للملفات قبل التحقق من المجموعة الكاملة)، وفحوصات الإدخال غير الموثوقة غير الحاجزة (اكتشاف محتوى خطير ولكن تنفيذ الإجراء مع ذلك). في ECOM1، عمل البحث الدقيق عن رمز المخزون وعملية الدفع القياسية بشكل جيد، لكن أنماط الفشل شملت فقدان الحالة بين الصفوف في التقارير متعددة الأسطر، ووضع علامات مفرطة على الحالات الشاذة، وغياب فحوصات الهوية قبل قراءة البيانات الخاصة، وتغييرات الحالة بسبب الإدخال غير الموثوق. حققت مهام التحسين (جدولة التوزيع) خططًا قابلة للتنفيذ لكنها دون المستوى الأمثل. تُظهر المقارنة مع عمليات تشغيل BitGN العامة الأخرى أن Kimi K3 منافس في المهام البسيطة لكنه متأخر في المهام المعقدة متعددة الخطوات.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة