النماذجالعوامل 🇷🇺 28.07.2026 07:03

كيمي K3 في PAC1 وECOM1: نتائج 204 مهمة وتحليل الفشل

Moonshot AIMoonshot AI
قامت Moonshot AI بفتح مصدر نموذج Kimi K3 في يوليو. تم اختبار النموذج على معياري BitGN (PAC1 وECOM1) باستخدام 204 تتبعًا مفتوحًا. تظهر النتائج أداءً قويًا في الاسترجاع البسيط والحسابات، ولكن حالات فشل متكررة في العمليات الذرية متعددة الملفات، والتحقق من المدخلات غير الموثوقة، واتساق الجداول الطويلة.
في 27 يوليو، نشرت Moonshot AI أوزانًا مفتوحة لنموذج Kimi K3 إلى جانب تقرير فني. للتحقق المستقل من الأداء، تم تشغيل النموذج على مجموعتي مهام من BitGN: PAC1 (المستندات والفواتير وصندوق الوارد وتغييرات الملفات الدفعية) وECOM1 (الكتالوج والمخزون وعربات التسوق والمدفوعات والمرتجعات والخدمات اللوجستية). سجل PAC1 61 من أصل 104 (ثنائي)، بينما سجل ECOM1 44.75 من أصل 100 (درجات جزئية). تسمح السجلات المفتوحة البالغ عددها 204 بفحص كل أمر وتغيير حالة. في PAC1، حققت مهام البحث البسيط والحساب نجاحًا بنسبة 90-92%، لكن ظهرت ثلاثة أنماط فشل رئيسية: انتهاك المخطط الدقيق (كتابة أسماء حقول مشابهة ولكن خاطئة)، والعمليات الدفعية غير الذرية (تغييرات جزئية للملفات قبل التحقق من المجموعة الكاملة)، وفحوصات الإدخال غير الموثوقة غير الحاجزة (اكتشاف محتوى خطير ولكن تنفيذ الإجراء مع ذلك). في ECOM1، عمل البحث الدقيق عن رمز المخزون وعملية الدفع القياسية بشكل جيد، لكن أنماط الفشل شملت فقدان الحالة بين الصفوف في التقارير متعددة الأسطر، ووضع علامات مفرطة على الحالات الشاذة، وغياب فحوصات الهوية قبل قراءة البيانات الخاصة، وتغييرات الحالة بسبب الإدخال غير الموثوق. حققت مهام التحسين (جدولة التوزيع) خططًا قابلة للتنفيذ لكنها دون المستوى الأمثل. تُظهر المقارنة مع عمليات تشغيل BitGN العامة الأخرى أن Kimi K3 منافس في المهام البسيطة لكنه متأخر في المهام المعقدة متعددة الخطوات.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة