Perangkat Keras & InferensiSumber Terbuka 🇷🇺 06.08.2026 00:03

Bonsai-27B pada fork llama.cpp rekursif: pengaturan lengkap dan benchmark nyata di RTX 3050

cubetitled-uicubetitled-ui
Artikel ketiga tentang fork llama.cpp rekursif ini membahas menjalankan model hibrida Bonsai-27B (arsitektur linier Delta-Net) pada GPU yang lemah, menunjukkan benchmark nyata kedalaman D=0 vs D=12 pada tugas kriptaritmetika. Dengan pengaktifan rekursi (D=12), model berhasil memecahkan SEND+MORE=MONEY, sementara mesin dasar gagal. Perintah pengaturan dan variabel lingkungan rekursi disediakan.
Penulis menyajikan bagian ketiga dari seri mereka tentang fork rekursif dari llama.cpp, yang berfokus pada Bonsai-27B, model hibrida dengan lapisan Delta-Net linier dan lapisan full-attention. Rekursi hanya diterapkan pada lapisan full-attention. Model dalam kuantisasi Q1_0 berukuran sekitar 3,5 GB, muat ke dalam VRAM 6 GB. Artikel ini memberikan instruksi build untuk CUDA dan CPU, serta perintah penggunaan dengan variabel lingkungan RECURRENT_D (kedalaman: 0, 12, 24), RECURRENT_LAYERS_COUNT, dan RECURRENT_KV. Benchmark nyata pada RTX 3050 Mobile 6 GB dengan seed 42 dan temperatur 0,3 dijalankan pada teka-teki aritmetika SEND+MORE=MONEY, dengan batas 7000 token. D=0 menghasilkan 7000 token tanpa menyelesaikan, mencapai batas panjang (finish_reason: length). D=12 menghasilkan 6594 token dan menyelesaikannya dengan benar dengan S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2, memverifikasi 9567+1085=10652, berhenti dengan benar (finish_reason: stop). Waktu generasi sekitar 5,5 menit untuk keduanya, dengan kecepatan 21,1 token/detik (D=0) dan 19,8 token/detik (D=12), sekitar 6% lebih lambat. Artikel tersebut mencatat bahwa rekursi tidak mengubah bobot, hanya grafik komputasi inferensi, dan mendaftar model yang kompatibel termasuk Qwen3.5, Qwen2, Gemma 2, Mistral 3, dan Delta-Net (Bonsai).
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru