Hardware e InferênciaCódigo Aberto 🇷🇺 06.08.2026 00:03

Bonsai-27B no fork recursivo do llama.cpp: configuração completa e benchmark real na RTX 3050

cubetitled-uicubetitled-ui
Este terceiro artigo sobre um fork recursivo do llama.cpp aborda a execução do modelo híbrido Bonsai-27B (arquitetura linear Delta-Net) em uma GPU fraca, mostrando um benchmark real da profundidade D=0 versus D=12 em uma tarefa de criptaritmética. Com a recorrência habilitada (D=12), o modelo resolveu SEND+MORE=MONEY, enquanto o motor base falhou. São fornecidos comandos de configuração e variáveis de ambiente para recorrência.
O autor apresenta a terceira parte da sua série sobre um fork recursivo do llama.cpp, focando no Bonsai-27B, um modelo híbrido com camadas lineares Delta-Net e camadas de atenção total. A recorrência é aplicada apenas às camadas de atenção total. O modelo em quantização Q1_0 tem cerca de 3,5 GB, cabendo em 6 GB de VRAM. O artigo fornece instruções de compilação para CUDA e CPU, e comandos de uso com as variáveis de ambiente RECURRENT_D (profundidade: 0, 12, 24), RECURRENT_LAYERS_COUNT e RECURRENT_KV. Foi executado um benchmark real numa RTX 3050 Mobile 6 GB com seed 42 e temperatura 0,3 no quebra-cabeça criptoaritmético SEND+MORE=MONEY, com um limite de 7000 tokens. D=0 gerou 7000 tokens sem resolver, atingindo o limite de comprimento (finish_reason: length). D=12 gerou 6594 tokens e resolveu corretamente o quebra-cabeça com S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2, verificando 9567+1085=10652, parando corretamente (finish_reason: stop). O tempo de geração foi de cerca de 5,5 minutos para ambos, com velocidades de 21,1 tokens por segundo (D=0) e 19,8 tokens por segundo (D=12), uma desaceleração de cerca de 6%. O artigo observa que a recorrência não altera os pesos, apenas o grafo de computação de inferência, e lista modelos compatíveis, incluindo Qwen3.5, Qwen2, Gemma 2, Mistral 3 e Delta-Net (Bonsai).
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas