Cách tôi thu nhỏ một mô hình nhúng tiếng Nga xuống còn 24 triệu tham số — và suýt phá hỏng nó chỉ vì một chữ số
DeepPavlov
BAAI
Microsoft
Một kỹ sư đã huấn luyện một mô hình truy xuất dày đặc tiếng Nga nhẹ, tên là STRIZH, với 24,4 triệu tham số và 4 lớp, dành cho hệ thống RAG cục bộ trên GPU dùng chung. Chỉ một con số sai trong cấu hình bộ mã hóa token (model_max_length=256) đã làm giảm Recall@10 từ 0,589 xuống 0,448, gần như phá hỏng toàn bộ công sức. Mô hình này được thiết kế để truy xuất nhanh ở giai đoạn đầu trên nền tảng AMD Strix Halo, cạnh tranh với bge-m3 trong các kịch bản sử dụng chung tài nguyên.
Tác giả đã phát triển một mô hình truy xuất dày đặc tiếng Nga nhỏ gọn có tên STRIZH cho một hệ thống RAG cục bộ chạy trên nút AMD Strix Halo với 128 GB bộ nhớ thống nhất. iGPU của nút được chia sẻ giữa mô hình ngôn ngữ sinh, bộ nhúng, bộ xếp hạng lại và quá trình lập chỉ mục định kỳ, vì vậy cần một bộ truy xuất nhẹ để giảm tranh chấp tính toán. Sau khi thử nghiệm hồi quy nhúng với hàm mất mát MSE thất bại, tác giả đã huấn luyện thành công một mô hình hiến tặng truy xuất 12 lớp bằng học tương phản rồi chưng cất xuống còn 4 lớp. STRIZH có 24,4 triệu tham số, kích thước vector 384, gộp trung bình, không có tiền tố truy vấn/đoạn văn và hỗ trợ ngữ cảnh tối đa 8192 token. Trên tập ngữ liệu cục bộ, mô hình đạt Recall@10 là 0,751 trên tập con đã lọc và 0,800 trên tập đầy đủ. Trong các bài kiểm tra đồng lưu trú với Qwen3.6-35B-A3B, STRIZH chỉ gây giảm 2% thông lượng sinh so với mức 7% của bge-m3 trong tải trực tuyến 200 truy vấn/giây, và lập chỉ mục 46 batch/giây so với 4,9. Tuy nhiên, một sai lầm đã được phát hiện sau khi xuất bản: cấu hình tokenizer có model_max_length=256, khi được áp dụng đã khiến Recall@10 giảm từ 0,589 xuống 0,448. Tác giả lưu ý rằng STRIZH không nhằm thay thế các mô hình lớn hơn như USER2-small hay bge-m3, mà để lấp đầy một phân khúc cho việc truy xuất dày đặc hiệu quả trong điều kiện ngân sách tính toán nghiêm ngặt.
Nguồn: Habr — хаб ИИ —
bản gốc
