Bonsai-27B en la bifurcación recursiva de llama.cpp: configuración completa y benchmark real en RTX 3050
cubetitled-ui
Este tercer artículo sobre una bifurcación recursiva de llama.cpp cubre la ejecución del modelo híbrido Bonsai-27B (arquitectura lineal Delta-Net) en una GPU débil, mostrando un benchmark real de profundidad D=0 frente a D=12 en una tarea criptoaritmética. Con la recurrencia habilitada (D=12), el modelo resolvió SEND+MORE=MONEY, mientras que el motor base falló. Se proporcionan comandos de configuración y variables de entorno para la recurrencia.
El autor presenta la tercera parte de su serie sobre un fork recursivo de llama.cpp, centrándose en Bonsai-27B, un modelo híbrido con capas lineales Delta-Net y capas de atención completa. La recurrencia se aplica solo a las capas de atención completa. El modelo en cuantización Q1_0 ocupa aproximadamente 3.5 GB, cabiendo en 6 GB de VRAM. El artículo proporciona instrucciones de compilación para CUDA y CPU, y comandos de uso con variables de entorno RECURRENT_D (profundidad: 0, 12, 24), RECURRENT_LAYERS_COUNT y RECURRENT_KV. Se ejecutó un benchmark real en una RTX 3050 Mobile de 6 GB con semilla 42 y temperatura 0.3 en el rompecabezas criptoaritmético SEND+MORE=MONEY, con un límite de 7000 tokens. Con D=0 se generaron 7000 tokens sin resolver, alcanzando el límite de longitud (finish_reason: length). Con D=12 se generaron 6594 tokens y se resolvió correctamente con S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2, verificando que 9567+1085=10652, deteniéndose adecuadamente (finish_reason: stop). El tiempo de generación fue de aproximadamente 5.5 minutos para ambos, con velocidades de 21.1 tokens por segundo (D=0) y 19.8 tokens por segundo (D=12), una desaceleración de aproximadamente el 6%. El artículo señala que la recurrencia no cambia los pesos, solo el grafo de cómputo de inferencia, y lista modelos compatibles, incluidos Qwen3.5, Qwen2, Gemma 2, Mistral 3 y Delta-Net (Bonsai).
Fuente: Habr — хаб ИИ —
original
