llama.cpp b10075 Update: vier verbeteringen aan de lokale AI-engine
Meta
De llama.cpp b10075-update introduceert vier belangrijke verbeteringen aan de lokale AI-inferentie-engine. Deze verbeteringen richten zich op prestaties, geheugenefficiëntie en nieuwe functies voor het lokaal uitvoeren van grote taalmodellen.
De recente update van llama.cpp, versie b10075, brengt vier grote verbeteringen aan de lokale AI-engine. Ten eerste wordt ondersteuning toegevoegd voor de Llama 4-modelfamilie, waarmee gebruikers deze modellen lokaal kunnen uitvoeren. Ten tweede wordt het geheugengebruik geoptimaliseerd door een betere afhandeling van de KV-cache, waardoor het RAM-verbruik tijdens inferentie wordt verminderd. Ten derde wordt een nieuwe speculatieve decoderingfunctie geïntroduceerd die de tekstgeneratie versnelt door gebruik te maken van een conceptmodel. Ten slotte wordt de compatibiliteit met verschillende hardware-backends verbeterd, waaronder AMD ROCm en Intel oneAPI, waardoor de GPU-ondersteuning wordt uitgebreid.
Bron: Meta AI (GNews) —
origineel
