llama.cpp b10075 업데이트: 로컬 AI 엔진에 4가지 개선 사항
Meta
llama.cpp b10075 업데이트는 로컬 AI 추론 엔진에 네 가지 주요 개선 사항을 도입했습니다. 이러한 개선은 성능, 메모리 효율성 및 대규모 언어 모델을 로컬에서 실행하기 위한 새로운 기능에 초점을 맞추고 있습니다.
최근 llama.cpp b10075 업데이트는 로컬 AI 엔진에 네 가지 주요 개선 사항을 제공합니다. 첫째, Llama 4 모델 제품군에 대한 지원을 추가하여 사용자가 이러한 모델을 로컬에서 실행할 수 있게 합니다. 둘째, 더 나은 KV 캐시 처리를 통해 메모리 사용을 최적화하여 추론 중 RAM 소비를 줄입니다. 셋째, 초안 모델을 사용하여 텍스트 생성을 가속화하는 새로운 추측 디코딩 기능을 도입합니다. 마지막으로, AMD ROCm 및 Intel oneAPI를 포함한 다양한 하드웨어 백엔드와의 호환성을 개선하여 GPU 지원을 확장합니다.
출처: Meta AI (GNews) —
원문
