Motor recursivo de llama.cpp en RTX 3050: pruebas de Qwen 32B y 7B Coder: mejora de calidad triplicada y apetitos de memoria
Mistral
Esta es la segunda parte de un artículo sobre una bifurcación de llama.cpp que añade un modo de procesamiento recursivo. El autor probó Qwen 32B y Qwen 2.5 Coder 7B en una RTX 3050 de 6 GB, comparando el motor estándar (D=0) con la bifurcación mejorada (D=12). El motor recursivo mejoró significativamente la calidad del código (hasta 3,1 veces más correcciones correctas), pero costó alrededor de un 11-13 % de velocidad de generación y aumentó el uso de VRAM.
El autor del artículo continúa probando un fork de llama.cpp que implementa un modo recursivo (designado D=12) contra el motor estándar (D=0). Las pruebas se ejecutaron en una tarjeta gráfica RTX 3050 de 6 GB, con todos los modelos en cuantización Q4. Para el modelo grande Qwen 32B-A3B, en tareas de benchmark fáciles ambos motores produjeron resultados idénticos, pero la versión recursiva fue ligeramente más lenta. En el segmento difícil, el motor recursivo corrigió casi 3.1 veces más errores en la tarea de revisión de código, aunque tomó un 17% más de tiempo. El autor señala que el motor recursivo resuelve el problema de la 'generación de código perezosa', produciendo scripts monolíticos completos en lugar de fragmentos fragmentados. Para Qwen 2.5 Coder 7B Instruct, la versión recursiva se desempeñó mejor en la revisión de código (encontró un error más), en el desarrollo fullstack cumplió totalmente los requisitos mientras que la versión estándar no lo hizo, y en la prueba del juego 2D fue un empate, con el motor recursivo evitando etiquetas inexistentes e implementando la lógica básica del juego. Para Mistral 7B Instruct v0.2, el motor recursivo mejoró significativamente la seguridad (98% protegido), mejoró drásticamente la plataforma fullstack (mejora de 2.2x, 100% de lógica de negocio) y produjo un diseño de juego más limpio. El principal inconveniente es una reducción de velocidad de aproximadamente un 13% y un mayor consumo de VRAM. El autor enlaza el repositorio del fork y Google Drive con resultados detallados.
Fuente: Habr — хаб ИИ —
original
