Bonsai-27B op recursieve llama.cpp-fork: volledige installatie en echte benchmark op RTX 3050
cubetitled-ui
Dit derde artikel over een recursieve llama.cpp-fork behandelt het draaien van het hybride Bonsai-27B-model (Delta-Net lineaire architectuur) op een zwakke GPU, met een echte benchmark van diepte D=0 versus D=12 bij een cryptaritmetische taak. Met recursie ingeschakeld (D=12) loste het model SEND+MORE=MONEY op, terwijl de basismotor faalde. Installatiecommando's en omgevingsvariabelen voor recursie worden verstrekt.
De auteur presenteert het derde deel van hun serie over een recursieve fork van llama.cpp, met de focus op Bonsai-27B, een hybride model met lineaire Delta-Net lagen en volledige aandacht lagen. Recurrentie wordt alleen toegepast op volledige aandacht lagen. Het model in Q1_0 kwantisering is ongeveer 3,5 GB en past in 6 GB VRAM. Het artikel geeft bouwinstructies voor CUDA en CPU, en gebruiksopdrachten met omgevingsvariabelen RECURRENT_D (diepte: 0, 12, 24), RECURRENT_LAYERS_COUNT en RECURRENT_KV. Een echte benchmark op een RTX 3050 Mobile 6 GB met seed 42 en temperatuur 0,3 werd uitgevoerd op de cryptaritmetische puzzel SEND+MORE=MONEY, met een limiet van 7000 tokens. D=0 genereerde 7000 tokens zonder op te lossen, en bereikte de lengtelimiet (finish_reason: length). D=12 genereerde 6594 tokens en loste het correct op met S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2, waarbij 9567+1085=10652 werd geverifieerd, en stopte correct (finish_reason: stop). De generatietijd was ongeveer 5,5 minuten voor beide, met snelheden van 21,1 t/s (D=0) en 19,8 t/s (D=12), een vertraging van ongeveer 6%. Het artikel merkt op dat recurrentie de gewichten niet verandert, alleen de inferentie-berekeningsgrafiek, en vermeldt compatibele modellen waaronder Qwen3.5, Qwen2, Gemma 2, Mistral 3 en Delta-Net (Bonsai).
Bron: Habr — хаб ИИ —
origineel
