ModèlesMatériel et Inférence 🇷🇺 31.07.2026 22:04

Moteur récursif llama.cpp sur RTX 3050 : tests de Qwen 32B et du Coder 7B — qualité triplée et appétits mémoire

MistralMistral
Ceci est la deuxième partie d'un article sur un fork de llama.cpp qui ajoute un mode de traitement récursif. L'auteur a testé Qwen 32B et Qwen 2.5 Coder 7B sur une RTX 3050 6 Go, en comparant le moteur standard (D=0) avec le fork amélioré (D=12). Le moteur récursif a considérablement amélioré la qualité du code (jusqu'à 3,1 fois plus de corrections correctes) mais a coûté environ 11 à 13 % de vitesse de génération et a augmenté l'utilisation de la mémoire vidéo.
L'auteur de l'article poursuit ses tests d'un fork de llama.cpp qui implémente un mode récursif (désigné D=12) par rapport au moteur standard (D=0). Les tests ont été exécutés sur une carte graphique RTX 3050 6 Go, avec tous les modèles en quantification Q4. Pour le grand modèle Qwen 32B-A3B, sur les tâches faciles du benchmark, les deux moteurs ont produit des résultats identiques, mais la version récursive était légèrement plus lente. Sur la partie difficile, le moteur récursif a corrigé environ 3,1 fois plus d'erreurs dans la tâche de revue de code, bien qu'il ait pris 17 % de temps en plus. L'auteur note que le moteur récursif résout le problème de « génération de code paresseuse », produisant des scripts monolithiques complets au lieu de fragments décousus. Pour Qwen 2.5 Coder 7B Instruct, la version récursive a mieux performé en revue de code (elle a trouvé un bug de plus), dans le développement fullstack elle a entièrement satisfait les exigences alors que la version standard ne l'a pas fait, et dans le test du jeu 2D ce fut un match nul, avec le moteur récursif évitant les balises inexistantes et implémentant la logique de base du jeu. Pour Mistral 7B Instruct v0.2, le moteur récursif a considérablement amélioré la sécurité (98 % protégé), a nettement amélioré la plateforme fullstack (amélioration de 2,2 fois, 100 % de logique métier) et a produit une mise en page de jeu plus propre. Le principal inconvénient est une réduction de vitesse d'environ 13 % et une consommation de mémoire VRAM accrue. L'auteur fournit des liens vers le dépôt du fork et Google Drive avec les résultats détaillés.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches