Actualización de llama.cpp b10075: cuatro mejoras en el motor local de IA
Meta
La actualización llama.cpp b10075 introduce cuatro mejoras clave en el motor local de inferencia de IA. Estas mejoras se centran en el rendimiento, la eficiencia de memoria y nuevas funcionalidades para ejecutar modelos de lenguaje de gran tamaño de forma local.
La reciente actualización b10075 de llama.cpp trae cuatro mejoras importantes al motor local de IA. En primer lugar, añade compatibilidad con la familia de modelos Llama 4, lo que permite a los usuarios ejecutar estos modelos localmente. En segundo lugar, optimiza el uso de memoria mediante una mejor gestión de la caché KV, reduciendo el consumo de RAM durante la inferencia. En tercer lugar, introduce una nueva función de decodificación especulativa que acelera la generación de texto utilizando un modelo borrador. Finalmente, mejora la compatibilidad con varios backends de hardware, incluyendo AMD ROCm e Intel oneAPI, ampliando la compatibilidad con GPU.
Fuente: Meta AI (GNews) —
original
