Atualização llama.cpp b10075: Quatro Melhorias no Motor de IA Local
Meta
A atualização llama.cpp b10075 introduz quatro melhorias-chave no motor de inferência de IA local. Essas melhorias focam em desempenho, eficiência de memória e novos recursos para executar modelos de linguagem grandes localmente.
A atualização recente llama.cpp b10075 traz quatro grandes melhorias para o motor de IA local. Primeiro, adiciona suporte à família de modelos Llama 4, permitindo que os usuários executem esses modelos localmente. Segundo, otimiza o uso de memória através de um melhor gerenciamento do cache KV, reduzindo o consumo de RAM durante a inferência. Terceiro, introduz um novo recurso de decodificação especulativa que acelera a geração de texto usando um modelo rascunho. Finalmente, melhora a compatibilidade com vários back-ends de hardware, incluindo AMD ROCm e Intel oneAPI, expandindo o suporte a GPUs.
Fonte: Meta AI (GNews) —
original
