Donanım ve ÇıkarımAçık Kaynak 🇷🇺 06.08.2026 00:03

Bonsai-27B, özyinelemeli llama.cpp çatalında: RTX 3050 üzerinde tam kurulum ve gerçek kıyaslama

cubetitled-uicubetitled-ui
Özyinelemeli llama.cpp çatalı hakkındaki bu üçüncü makale, hibrit Bonsai-27B modelini (Delta-Net doğrusal mimarisi) zayıf bir GPU üzerinde çalıştırmayı kapsıyor ve bir kriptaritmetik görevde D=0 ile D=12 derinliğinin gerçek bir kıyaslamasını gösteriyor. Yinelenme etkinleştirildiğinde (D=12), model SEND+MORE=MONEY bulmacasını çözerken, temel motor başarısız oldu. Kurulum komutları ve yinelenme ortam değişkenleri sağlanmıştır.
Yazar, llama.cpp'nin özyinelemeli bir çatalı üzerine serilerinin üçüncü bölümünü sunuyor ve doğrusal Delta-Net katmanları ile tam dikkat katmanlarına sahip hibrit bir model olan Bonsai-27B'ye odaklanıyor. Özyineleme yalnızca tam dikkat katmanlarına uygulanıyor. Q1_0 nicelemesindeki model yaklaşık 3,5 GB olup 6 GB VRAM'e sığıyor. Makale, CUDA ve CPU için derleme talimatları ve RECURRENT_D (derinlik: 0, 12, 24), RECURRENT_LAYERS_COUNT ve RECURRENT_KV ortam değişkenleriyle kullanım komutları sağlıyor. RTX 3050 Mobile 6 GB üzerinde tohum 42 ve sıcaklık 0,3 ile gerçek bir kıyaslama, SEND+MORE=MONEY kriptaritmetik bulmacası üzerinde 7000 jeton sınırıyla çalıştırıldı. D=0, 7000 jeton üretti ve çözemeden uzunluk sınırına ulaştı (bitiş_nedeni: uzunluk). D=12, 6594 jeton üretti ve S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2 ile doğru şekilde çözdü; 9567+1085=10652'yi doğrulayarak düzgün durdu (bitiş_nedeni: dur). Her ikisi için üretim süresi yaklaşık 5,5 dakikaydı; hızlar 21,1 jeton/s (D=0) ve 19,8 jeton/s (D=12) olarak ölçüldü; bu yaklaşık %6'lık bir yavaşlama demek. Makale, özyinelemenin ağırlıkları değiştirmediğini, yalnızca çıkarım hesaplama grafiğini değiştirdiğini belirtiyor ve Qwen3.5, Qwen2, Gemma 2, Mistral 3 ve Delta-Net (Bonsai) dahil uyumlu modelleri listeliyor.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler