محرك llama.cpp التكراري على RTX 3050: اختبارات Qwen 32B و7B للمبرمجين — تحسين الجودة 3 مرات واستهلاك الذاكرة

MistralMistral
هذا هو الجزء الثاني من مقال حول نسخة معدلة من llama.cpp تضيف وضع المعالجة التكراري. اختبر المؤلف Qwen 32B وQwen 2.5 Coder 7B على RTX 3050 بسعة 6 جيجابايت، مقارنة المحرك القياسي (D=0) مع النسخة المحسنة (D=12). المحرك التكراري حسّن جودة الكود بشكل كبير (حتى 3.1 أضعاف الإصلاحات الصحيحة) لكنه كلف حوالي 11-13% من سرعة التوليد وزاد استخدام الذاكرة الافتراضية.
مؤلف المقال يواصل اختبار نسخة مشتقة من llama.cpp تنفّذ وضعًا تكراريًا (يُشار إليه بـ D=12) مقارنةً بالمحرك القياسي (D=0). أُجريت الاختبارات على بطاقة رسوميات RTX 3050 بسعة 6 جيجابايت، مع جميع النماذج بترميز Q4. بالنسبة لنموذج Qwen 32B-A3B الكبير، في مهام المعايير السهلة أنتج المحركان نتائج متطابقة، لكن النسخة التكرارية كانت أبطأ قليلاً. في الجزء الصعب، أصلح المحرك التكراري أخطاءً أكثر بنحو 3.1 مرات في مهمة مراجعة الكود، على الرغم من أنه استغرق وقتًا أطول بنسبة 17%. يلاحظ المؤلف أن المحرك التكراري يحل مشكلة "توليد الكود الكسول"، منتجًا نصوصًا برمجية متكاملة بدلاً من مقاطع مجزأة. بالنسبة لنموذج Qwen 2.5 Coder 7B Instruct، كان أداء النسخة التكرارية أفضل في مراجعة الكود (عثرت على خطأ إضافي)، وفي تطوير الواجهة الكاملة حققت المتطلبات بالكامل بينما لم تفعل النسخة القياسية ذلك، وفي اختبار اللعبة ثنائية الأبعاد كان التعادل، مع تجنب المحرك التكراري للوسوم غير الموجودة وتنفيذ منطق اللعبة الأساسي. بالنسبة لنموذج Mistral 7B Instruct v0.2، حسّن المحرك التكراري الأمان بشكل ملحوظ (حماية 98%)، وحسّن بشكل كبير منصة الواجهة الكاملة (تحسين بمقدار 2.2 مرة، ومنطق أعمال 100%)، وأنتج تخطيط لعبة أنظف. العيب الرئيسي هو انخفاض السرعة بنحو 13% وزيادة استهلاك ذاكرة الفيديو. يضع المؤلف رابطًا لمستودع النسخة المشتقة ورابط Google Drive يحتوي على النتائج التفصيلية.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة