Mô hình 🇷🇺 04.08.2026 11:04

Prompt, RAG, hay fine-tuning: điều gì thực sự giúp LLM của bạn học hỏi

Trong bài viết này, Sergey Proshchaev, Trưởng nhóm kỹ thuật trong lĩnh vực FinTech và Thương mại điện tử, so sánh ba cách tiếp cận để dạy cho một LLM kiến thức miền: prompting với ngữ cảnh, RAG, và tinh chỉnh QLoRA. Sử dụng một mô hình (Qwen3-8B) và một GPU (RTX 4090), ông đã thử nghiệm cả ba phương pháp trên cùng 30 câu hỏi. Kết quả cho thấy RAG là tốt nhất cho các câu hỏi thực tế, QLoRA vượt trội về định dạng và thuật ngữ, nhưng thất bại với dữ liệu cập nhật, và prompting là một điểm khởi đầu tốt nhưng có những hạn chế.
Sergey Proshchaev, Tech Lead trong lĩnh vực FinTech & E-commerce, đã tiến hành một thử nghiệm để so sánh ba cách dạy kiến thức miền cụ thể cho mô hình ngôn ngữ nhỏ (LLM): prompt kèm ngữ cảnh, RAG (retrieval-augmented generation - tạo sinh tăng cường truy hồi) và fine-tuning (tinh chỉnh) bằng QLoRA. Anh sử dụng mô hình Qwen3-8B và một chiếc RTX 4090 với 24 GB VRAM. Lĩnh vực được chọn là tài liệu thanh toán nội bộ: khoảng 120 trang quy định, bao gồm mã phản hồi của acquirer, quy tắc thử lại, định tuyến thanh toán, hạn mức và các trường hợp ngoại lệ. Anh đã tạo ra 30 câu hỏi thuộc ba loại: câu hỏi thực tế, câu hỏi tổng hợp (yêu cầu tổng hợp thông tin từ nhiều phần) và câu hỏi định dạng (tuân theo mẫu báo cáo sự cố nội bộ). Với phương pháp prompt, anh đưa toàn bộ quy định vào ngữ cảnh (128K token) và nhận được 20 câu trả lời đúng tổng thể, nhưng gặp phải hiện tượng 'Lost in the Middle' và độ trễ cao. Với RAG, anh sử dụng chunking (500 token có overlap), embeddings BAAI/bge-m3 và Qdrant làm cơ sở dữ liệu vector, truy hồi top-5 chunk. RAG đạt 9/10 cho câu hỏi thực tế và cung cấp nguồn tham khảo, nhưng thất bại với câu hỏi tổng hợp và không thể học được thuật ngữ nội bộ. Với QLoRA, anh tạo khoảng 800 cặp câu hỏi - trả lời bằng một mô hình mạnh hơn, làm sạch bằng tay, và huấn luyện một adapter LoRA trong khoảng 40 phút. Mô hình sau tinh chỉnh vượt trội ở câu hỏi định dạng (10/10) và cải thiện câu hỏi tổng hợp (8/10), nhưng lại thất bại với các dữ kiện được cập nhật, trả lời theo các hạn mức cũ từ bộ dữ liệu. Tác giả kết luận rằng các phương pháp này không phải là đối thủ của nhau mà là các lớp bổ sung: bắt đầu với prompt, sau đó thêm RAG để đạt độ chính xác về dữ kiện và trích dẫn nguồn, và dùng fine-tuning khi bạn cần mô hình học theo một phong cách hoặc thuật ngữ cụ thể. Nghiên cứu cũng đề cập rằng Unsloth Studio và H2O LLM Studio cung cấp tính năng tinh chỉnh qua giao diện đồ họa (GUI), và nghiên cứu LoRA Land của Predibase đã chỉ ra rằng các mô hình được tinh chỉnh có thể vượt qua GPT-4 trong các tác vụ hẹp.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới