Bonsai-27B trên nhánh llama.cpp đệ quy: thiết lập đầy đủ và benchmark thực tế trên RTX 3050
cubetitled-ui
Bài viết thứ ba về nhánh llama.cpp đệ quy này trình bày cách chạy mô hình lai Bonsai-27B (kiến trúc tuyến tính Delta-Net) trên GPU yếu, cùng với benchmark thực tế về độ sâu D=0 so với D=12 trong bài toán số học viết tay. Khi kích hoạt đệ quy (D=12), mô hình giải được SEND+MORE=MONEY, trong khi engine cơ bản thất bại. Các lệnh thiết lập và biến môi trường cho đệ quy cũng được cung cấp.
Tác giả trình bày phần thứ ba trong loạt bài về một nhánh fork đệ quy của llama.cpp, tập trung vào Bonsai-27B, một mô hình lai với các lớp Delta-Net tuyến tính và các lớp full-attention. Phép đệ quy chỉ được áp dụng cho các lớp full-attention. Mô hình ở định dạng lượng tử Q1_0 có dung lượng khoảng 3,5 GB, vừa với 6 GB VRAM. Bài viết cung cấp hướng dẫn biên dịch cho CUDA và CPU, cùng các lệnh sử dụng với các biến môi trường RECURRENT_D (chiều sâu: 0, 12, 24), RECURRENT_LAYERS_COUNT, và RECURRENT_KV. Một bài kiểm tra thực tế trên RTX 3050 Mobile 6 GB với seed 42 và temperature 0,3 đã được chạy trên câu đố số học SEND+MORE=MONEY, với giới hạn 7000 token. Với D=0, mô hình tạo ra 7000 token mà không giải được, chạm giới hạn độ dài (finish_reason: length). Với D=12, mô hình tạo ra 6594 token và giải đúng với S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2, xác minh 9567+1085=10652, dừng đúng cách (finish_reason: stop). Thời gian tạo cho cả hai khoảng 5,5 phút, với tốc độ 21,1 token/giây (D=0) và 19,8 token/giây (D=12), giảm khoảng 6%. Bài viết lưu ý rằng đệ quy không thay đổi trọng số, chỉ thay đổi đồ thị tính toán suy luận, và liệt kê các mô hình tương thích bao gồm Qwen3.5, Qwen2, Gemma 2, Mistral 3, và Delta-Net (Bonsai).
Nguồn: Habr — хаб ИИ —
bản gốc
