रिकर्सिव llama.cpp फोर्क पर Bonsai-27B: RTX 3050 पर पूर्ण सेटअप और वास्तविक बेंचमार्क

cubetitled-uicubetitled-ui
रिकर्सिव llama.cpp फोर्क पर यह तीसरा लेख कमजोर GPU पर हाइब्रिड Bonsai-27B मॉडल (Delta-Net रैखिक वास्तुकला) चलाने को कवर करता है, और क्रिप्टो-अंकगणितीय कार्य पर गहराई D=0 बनाम D=12 का वास्तविक बेंचमार्क दिखाता है। पुनरावृत्ति सक्षम (D=12) के साथ, मॉडल ने SEND+MORE=MONEY को हल किया, जबकि बेस इंजन विफल रहा। सेटअप कमांड और पुनरावृत्ति पर्यावरण चर प्रदान किए गए हैं।
लेखक llama.cpp के एक पुनरावर्ती फोर्क पर अपनी श्रृंखला का तीसरा भाग प्रस्तुत करता है, जो Bonsai-27B पर केंद्रित है, जो रैखिक Delta-Net परतों और पूर्ण-ध्यान परतों वाला एक हाइब्रिड मॉडल है। पुनरावृत्ति केवल पूर्ण-ध्यान परतों पर लागू होती है। Q1_0 क्वांटाइजेशन में मॉडल लगभग 3.5 GB है, जो 6 GB VRAM में फिट हो जाता है। लेख CUDA और CPU के लिए बिल्ड निर्देश प्रदान करता है, और RECURRENT_D (गहराई: 0, 12, 24), RECURRENT_LAYERS_COUNT, और RECURRENT_KV पर्यावरण चर के साथ उपयोग कमांड प्रदान करता है। RTX 3050 Mobile 6 GB पर seed 42 और temperature 0.3 के साथ एक वास्तविक बेंचमार्क क्रिप्टो-अंकगणित पहेली SEND+MORE=MONEY पर चलाया गया था, जिसमें 7000-टोकन सीमा थी। D=0 ने बिना हल किए 7000 टोकन उत्पन्न किए, लंबाई सीमा (finish_reason: length) को हिट किया। D=12 ने 6594 टोकन उत्पन्न किए और इसे सही ढंग से हल किया, S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2, सत्यापित करते हुए 9567+1085=10652, ठीक से रुकते हुए (finish_reason: stop)। दोनों के लिए जनरेट समय लगभग 5.5 मिनट था, जिसमें गति 21.1 टोकन प्रति सेकंड (D=0) और 19.8 टोकन प्रति सेकंड (D=12), लगभग 6% धीमी थी। लेख नोट करता है कि पुनरावृत्ति वजन नहीं बदलती है, केवल अनुमान की गणना ग्राफ को बदलती है, और Qwen3.5, Qwen2, Gemma 2, Mistral 3, और Delta-Net (Bonsai) सहित संगत मॉडलों की सूची देता है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार