Mise à jour llama.cpp b10075 : Quatre améliorations du moteur d'IA local
Meta
La mise à jour llama.cpp b10075 apporte quatre améliorations clés au moteur d'inférence d'IA local. Ces améliorations portent sur les performances, l'efficacité mémoire et de nouvelles fonctionnalités pour exécuter des modèles de langage de grande taille localement.
La récente mise à jour b10075 de llama.cpp apporte quatre améliorations majeures au moteur d'IA local. Premièrement, elle ajoute la prise en charge de la famille de modèles Llama 4, permettant aux utilisateurs d'exécuter ces modèles localement. Deuxièmement, elle optimise l'utilisation de la mémoire grâce à une meilleure gestion du cache KV, réduisant la consommation de RAM lors de l'inférence. Troisièmement, elle introduit une nouvelle fonctionnalité de décodage spéculatif qui accélère la génération de texte en utilisant un modèle de brouillon. Enfin, elle améliore la compatibilité avec différents backends matériels, notamment AMD ROCm et Intel oneAPI, élargissant la prise en charge des GPU.
Source: Meta AI (GNews) —
original
