Mô hìnhPhần cứng & Suy luận 🇷🇺 31.07.2026 22:04

Công cụ llama.cpp đệ quy trên RTX 3050: Kiểm tra Qwen 32B và 7B Coder — Tăng chất lượng gấp 3 lần và dung lượng bộ nhớ

MistralMistral
Đây là phần thứ hai của một bài viết về một nhánh của llama.cpp bổ sung chế độ xử lý đệ quy. Tác giả đã thử nghiệm Qwen 32B và Qwen 2.5 Coder 7B trên RTX 3050 6 GB, so sánh công cụ tiêu chuẩn (D=0) với nhánh cải tiến (D=12). Công cụ đệ quy cải thiện đáng kể chất lượng mã (sửa lỗi đúng tăng tới 3.1 lần) nhưng làm giảm tốc độ tạo sinh khoảng 11-13% và tăng mức sử dụng VRAM.
Tác giả bài viết tiếp tục thử nghiệm một bản fork của llama.cpp triển khai chế độ đệ quy (được ký hiệu là D=12) so với engine tiêu chuẩn (D=0). Các thử nghiệm được chạy trên card đồ họa RTX 3050 6 GB, với tất cả các mô hình ở định dạng lượng tử Q4. Đối với mô hình lớn Qwen 32B-A3B, trong các tác vụ benchmark dễ, cả hai engine cho kết quả giống hệt nhau, nhưng phiên bản đệ quy chậm hơn một chút. Trong phần khó, engine đệ quy đã sửa lỗi nhiều hơn gần 3.1 lần trong tác vụ đánh giá mã, mặc dù mất thêm 17% thời gian. Tác giả lưu ý rằng engine đệ quy giải quyết vấn đề 'tạo mã lười biếng', tạo ra các tập lệnh nguyên khối hoàn chỉnh thay vì các đoạn mã rời rạc. Đối với Qwen 2.5 Coder 7B Instruct, phiên bản đệ quy hoạt động tốt hơn trong đánh giá mã (tìm thấy thêm một lỗi), trong phát triển fullstack thì đáp ứng đầy đủ yêu cầu trong khi phiên bản tiêu chuẩn không làm được, và trong bài kiểm tra trò chơi 2D là hòa, với engine đệ quy tránh được các thẻ không tồn tại và triển khai logic trò chơi cơ bản. Đối với Mistral 7B Instruct v0.2, engine đệ quy cải thiện đáng kể bảo mật (bảo vệ 98%), cải thiện đáng kể nền tảng fullstack (cải thiện gấp 2.2 lần, 100% logic kinh doanh) và tạo ra bố cục trò chơi sạch hơn. Nhược điểm chính là giảm tốc độ khoảng 13% và tăng tiêu thụ VRAM. Tác giả đính kèm liên kết kho lưu trữ fork và Google Drive chứa kết quả chi tiết.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới