Bonsai-27B recursiivisessa llama.cpp-haarassa: täysi asennus ja oikea vertailuarvo RTX 3050:llä
cubetitled-ui
Tämä kolmas artikkeli recursiivisesta llama.cpp-haarasta käsittelee hybridi-Bonsai-27B-mallin (Delta-Net-lineaarinen arkkitehtuuri) suorittamista heikolla GPU:lla, ja esittelee oikean vertailuarvon syvyydestä D=0 vs D=12 kryptaritmeettisessä tehtävässä. Kun toisto on käytössä (D=12), malli ratkaisi SEND+MORE=MONEY-tehtävän, kun taas perusmoottori epäonnistui. Asennuskomennot ja toistomuuttujat on annettu.
Kirjoittaja esittelee kolmannen osan sarjastaan llama.cpp:n rekursiivisesta haarasta keskittyen Bonsai-27B:hen, hybridimalliin, jossa on lineaarisia Delta-Net-kerroksia ja täysin huomioivia kerroksia. Rekursio sovelletaan vain täysin huomioiviin kerroksiin. Malli Q1_0-kvantisoituna on noin 3,5 Gt, joten se mahtuu 6 Gt:n VRAM-muistiin. Artikkeli antaa rakennusohjeet CUDA:lle ja CPU:lle sekä käyttökomennot ympäristömuuttujilla RECURRENT_D (syvyys: 0, 12, 24), RECURRENT_LAYERS_COUNT ja RECURRENT_KV. Oikea vertailu suoritettiin RTX 3050 Mobile 6 Gt:llä siemenellä 42 ja lämpötilalla 0,3 kryptaritmeettisessä tehtävässä SEND+MORE=MONEY, 7000 tokenin rajoituksella. D=0 tuotti 7000 tokenia ratkaisematta ongelmaa, osuen pituusrajaan (finish_reason: length). D=12 tuotti 6594 tokenia ja ratkaisi tehtävän oikein arvoilla S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2, vahvistaen laskun 9567+1085=10652, pysähtyen asianmukaisesti (finish_reason: stop). Generointiaika oli molemmissa noin 5,5 minuuttia, nopeuksilla 21,1 tokenia sekunnissa (D=0) ja 19,8 tokenia sekunnissa (D=12), eli noin 6 % hidastuminen. Artikkelissa huomautetaan, että rekursio ei muuta painoja, vaan ainoastaan päättelyn laskentagraafia, ja listataan yhteensopivia malleja, kuten Qwen3.5, Qwen2, Gemma 2, Mistral 3 ja Delta-Net (Bonsai).
Lähde: Habr — хаб ИИ —
Alkuperäinen
