Suy luận mô hình ngôn ngữ lớn trên cụm máy tính xách tay cũ
Meta
Alibaba/Qwen
OpenAI
Một thử nghiệm đã kiểm tra việc suy luận phân tán mô hình ngôn ngữ lớn trên ba máy tính xách tay cũ sử dụng giao thức RPC của llama.cpp. Kết quả cho thấy suy luận phân tán chỉ mang lại tốc độ tăng đáng kể khi mô hình không vừa vào bộ nhớ của một nút duy nhất; đối với các mô hình nhỏ hơn, chi phí mạng khiến một nút nhanh duy nhất nhanh hơn. Thử nghiệm cũng tiết lộ rằng xử lý prompt được hưởng lợi từ tính song song, trong khi việc tạo token thì không.
Một thí nghiệm đã được tiến hành để kiểm tra suy luận LLM phân tán trên một cụm ba máy tính xách tay cũ với bộ xử lý Intel thuộc các thế hệ khác nhau: Core i7-4700MQ (Haswell, 2013), Core i5-8265U (Whiskey Lake, 2018) và Core i3-1115G4 (Tiger Lake, 2020), tổng cộng 52 GB RAM. Phần mềm sử dụng là llama.cpp (bản dựng b10069) với máy chủ RPC trên mỗi nút, và các nút được kết nối qua Ethernet gigabit. Các mô hình được kiểm tra là Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct (tất cả Q4_K_M) và gpt-oss-20b (MoE). Với mô hình 1B, cụm (i3+i5) cho 22,5 token/giây khi sinh văn bản so với 29,2 token/giây trên nút đơn tốt nhất (i3), chậm hơn 23%. Với mô hình 8B, cụm gần như ngang bằng với nút đơn (4,6 so với 4,9 token/giây), nhưng xử lý prompt nhanh hơn gần 3 lần (10,9 so với 3,9 token/giây). Với mô hình 32B, không thể chạy trên bất kỳ nút đơn nào, cụm đạt 1,1 token/giây so với 0,3 token/giây trên nút có sử dụng bộ nhớ hoán đổi (swap), cải thiện 268%. Với mô hình MoE gpt-oss-20b, cũng không thể chạy trên một nút đơn, cụm cho tốc độ sinh ổn định 8,0-8,1 token/giây và đánh giá prompt 15,4-15,9 token/giây, so với hiệu suất không ổn định trên nút đơn. Kết luận là suy luận phân tán chỉ hợp lý khi mô hình không vừa trong một nút; ngược lại, một nút nhanh duy nhất tốt hơn. Ngoài ra, xử lý prompt được hưởng lợi từ song song hóa, trong khi sinh token thì không, và bất kỳ nút yếu nào cũng có thể trở thành nút thắt cổ chai cho cụm.
Nguồn: Habr — хаб ML —
bản gốc
