पुराने लैपटॉप्स के क्लस्टर पर LLM इंफेरेंस

MetaMeta Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
एक प्रयोग में तीन पुराने लैपटॉप्स पर llama.cpp के RPC प्रोटोकॉल का उपयोग करके वितरित LLM इंफेरेंस का परीक्षण किया गया। परिणाम बताते हैं कि वितरित इंफेरेंस केवल तब महत्वपूर्ण गति प्रदान करता है जब मॉडल एक नोड की मेमोरी में फिट नहीं होता; छोटे मॉडलों के लिए, नेटवर्क ओवरहेड के कारण एकल तेज़ नोड तेज़ होता है। परीक्षण से यह भी पता चला कि प्रॉम्प्ट प्रोसेसिंग समानांतरता से लाभान्वित होती है, जबकि टोकन जनरेशन नहीं।
एक प्रयोग किया गया जिसमें तीन पुराने लैपटॉपों के क्लस्टर पर वितरित LLM इंफेरेंस का परीक्षण किया गया, जिनमें Intel CPU अलग-अलग पीढ़ियों के थे: Core i7-4700MQ (Haswell, 2013), Core i5-8265U (Whiskey Lake, 2018), और Core i3-1115G4 (Tiger Lake, 2020), कुल 52 GB RAM के साथ। इस्तेमाल किया गया सॉफ्टवेयर llama.cpp (बिल्ड b10069) था, जिसमें प्रत्येक नोड पर RPC सर्वर चल रहा था, और नोड्स गीगाबिट ईथरनेट के माध्यम से जुड़े थे। परीक्षण किए गए मॉडल थे: Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct (सभी Q4_K_M), और gpt-oss-20b (MoE)। 1B मॉडल के लिए, क्लस्टर (i3+i5) ने 22.5 t/s टोकन जनरेशन दिया, जबकि सर्वश्रेष्ठ एकल नोड (i3) ने 29.2 t/s दिया, यानी 23% की धीमी गति। 8B मॉडल के लिए, क्लस्टर लगभग एकल नोड के समान था (4.6 बनाम 4.9 t/s), लेकिन प्रॉम्प्ट प्रोसेसिंग लगभग 3 गुना तेज़ थी (10.9 बनाम 3.9 t/s)। 32B मॉडल के लिए, जो किसी एकल नोड में फिट नहीं हुआ, क्लस्टर ने 1.1 t/s की गति प्राप्त की, जबकि स्वैपिंग वाले नोड पर यह 0.3 t/s थी, यानी 268% सुधार। MoE मॉडल gpt-oss-20b के साथ, जो एकल नोड पर भी फिट नहीं था, क्लस्टर ने स्थिर 8.0-8.1 t/s जनरेशन और 15.4-15.9 t/s प्रॉम्प्ट eval दिया, जबकि एकल नोड का प्रदर्शन अस्थिर था। निष्कर्ष यह है कि वितरित इंफेरेंस तभी उचित है जब मॉडल एक नोड में फिट नहीं होता; अन्यथा, एक तेज़ एकल नोड बेहतर होता है। इसके अलावा, प्रॉम्प्ट प्रोसेसिंग समानांतरता से लाभान्वित होती है, जबकि टोकन जनरेशन को लाभ नहीं मिलता, और कोई भी कमज़ोर नोड क्लस्टर के लिए बाधा बन सकता है।
स्रोत: Habr — хаб ML — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार