Tinh chỉnh ruGPT-3 XL 1.3B lên trình độ LLM hiện đại và so sánh với Gemma3 1B
Сбербанк
Google/DeepMind
Mô hình ruGPT-3 XL 1.3B cũ từ năm 2020 đã được tinh chỉnh bằng phương pháp SFT và DPO, biến nó thành một LLM theo hướng dẫn hiện đại. Kết quả được so sánh với mô hình Gemma3 1B năm 2025, cho thấy ruGPT đã tinh chỉnh thường vượt trội hơn Gemma3 về logic và sáng tạo, mặc dù nó gặp khó khăn với các hướng dẫn phủ định và nhập vai.
Mô hình ruGPT-3 XL 1.3B vốn ban đầu là một mô hình tiền huấn luyện từ năm 2020 chỉ có khả năng tiếp tục văn bản, đã được tinh chỉnh bằng SFT (Supervised Fine-Tuning - tinh chỉnh có giám sát) và DPO (Direct Preference Optimization - tối ưu hóa ưu tiên trực tiếp) để tạo ra một LLM hiện đại có khả năng tuân theo hướng dẫn. Sau khi SFT trên bộ dữ liệu 42 triệu token có nguồn gốc từ saiga_preferences, mô hình đã học cách làm theo hướng dẫn, trả lời câu hỏi và duy trì hội thoại nhiều lượt. Sau đó, nó được so sánh với Gemma3 1B, một mô hình năm 2025 được huấn luyện trên 2 nghìn tỷ token. RuGPT đã tinh chỉnh hoạt động tốt hơn trong các nhiệm vụ như kiến thức về ban nhạc rock Nga, hội thoại nhiều bước, câu hỏi về vật lý lượng tử và một câu đố không gian. Nó cũng xử lý các hướng dẫn phủ định (ví dụ: tránh một từ cụ thể) sau nhiều lần tái tạo, trong khi Gemma3 thất bại ở hầu hết các tác vụ ngoại trừ nhập vai và mô phỏng thiết bị đầu cuối, nơi ruGPT gặp khó khăn. DPO cải thiện thêm khả năng căn chỉnh, mặc dù bài báo lưu ý rằng bộ dữ liệu SFT nhỏ đã hạn chế khả năng tổng quát hóa.
Nguồn: Habr — хаб ML —
bản gốc
