Bản cập nhật llama.cpp b10075: Bốn cải tiến cho công cụ AI cục bộ
Meta
Bản cập nhật llama.cpp b10075 giới thiệu bốn cải tiến chính cho công cụ suy luận AI cục bộ. Các cải tiến này tập trung vào hiệu suất, hiệu quả bộ nhớ và các tính năng mới để chạy các mô hình ngôn ngữ lớn tại chỗ.
Bản cập nhật llama.cpp b10075 gần đây mang lại bốn cải tiến lớn cho công cụ AI cục bộ. Đầu tiên, nó bổ sung hỗ trợ cho dòng mô hình Llama 4, cho phép người dùng chạy các mô hình này cục bộ. Thứ hai, nó tối ưu hóa việc sử dụng bộ nhớ thông qua xử lý bộ đệm khóa-giá trị (KV cache) tốt hơn, giảm tiêu thụ RAM trong quá trình suy luận. Thứ ba, nó giới thiệu tính năng giải mã suy đoán (speculative decoding) mới giúp tăng tốc sinh văn bản bằng cách sử dụng mô hình nháp. Cuối cùng, nó cải thiện khả năng tương thích với các nền tảng phần cứng khác nhau, bao gồm AMD ROCm và Intel oneAPI, mở rộng hỗ trợ GPU.
Nguồn: Meta AI (GNews) —
bản gốc
