Código AbiertoHardware e Inferencia 🇺🇸 24.07.2026 07:03

Actualización de llama.cpp b10075: cuatro mejoras en el motor local de IA

MetaMeta
La actualización llama.cpp b10075 introduce cuatro mejoras clave en el motor local de inferencia de IA. Estas mejoras se centran en el rendimiento, la eficiencia de memoria y nuevas funcionalidades para ejecutar modelos de lenguaje de gran tamaño de forma local.
La reciente actualización b10075 de llama.cpp trae cuatro mejoras importantes al motor local de IA. En primer lugar, añade compatibilidad con la familia de modelos Llama 4, lo que permite a los usuarios ejecutar estos modelos localmente. En segundo lugar, optimiza el uso de memoria mediante una mejor gestión de la caché KV, reduciendo el consumo de RAM durante la inferencia. En tercer lugar, introduce una nueva función de decodificación especulativa que acelera la generación de texto utilizando un modelo borrador. Finalmente, mejora la compatibilidad con varios backends de hardware, incluyendo AMD ROCm e Intel oneAPI, ampliando la compatibilidad con GPU.
Fuente: Meta AI (GNews) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas