فريق KwaiKAT يقدم KAT-Coder-V2.5: نموذج برمجة وكيل مدرب على أكثر من 100,000 مستودع قابل للتحقق
Anthropic
أطلق فريق KwaiKAT في كواي شو نموذج البرمجة KAT-Coder-V2.5، المدرب على أكثر من 100,000 بيئة قابلة للتحقق. يتصدر النموذج معيار PinchBench بنتيجة 94.9 ويحتل المرتبة الثانية على SWE-Bench Pro بنتيجة 65.2. ويتوفر البديل مفتوح الأوزان KAT-Coder-V2.5-Dev على هاغينغ فيس تحت ترخيص أباتشي 2.0.
أعلن فريق KwaiKAT في شركة Kuaishou عن إطلاق KAT-Coder-V2.5، وهو نموذج ترميز وكيل تم تدريبه على أكثر من 100,000 مستودع قابل للتحقق بلغات متعددة تشمل 12 لغة. يستخدم النموذج خط أنابيب يُدعى AutoBuilder، والذي يبني بيئات قابلة للتنفيذ بمعدل نجاح يبلغ 57.2%. تم إصلاح مشاكل البنية التحتية للتدريب بعد أن كشف تدقيق أن حوالي 16% من مسارات التعلم المعزز (RL) فشلت بسبب أخطاء في البيئة الرملية (sandbox)، والتي انخفضت إلى أقل من 2%. يستخدم النموذج أسلوب PPO غير المتماثل مع نظام مكافآت ثلاثي المستويات وتقطير متعدد المعلمين. تحت إطار عمل Claude Code الموحد، يتصدر KAT-Coder-V2.5 منصة PinchBench بنتيجة 94.9، متغلبًا على Opus 4.8 الذي حصل على 93.5، ويحتل المرتبة الثانية في كل من SWE-Bench Pro (65.2 مقابل 69.2) وKAT Code Bench (53.1 مقابل 57.3)، ولكنه يتأخر في Terminal-Bench 2.1 (60.7) وSciCode (50.3). الإصدار مفتوح الأوزان KAT-Coder-V2.5-Dev هو نموذج MoE منفصل بحجم 35B إجمالي/3B نشط، تم تدريبه لاحقًا على Qwen3.6-35B-A3B، وتم إصداره على Hugging Face بموجب ترخيص Apache-2.0.
المصدر: MarkTechPost —
الأصلي
