Cách tôi thất bại khi khiến Gemma 4 viết thơ Nga hay: Câu chuyện cảnh báo về overfitting và số liệu mù quáng
Google/DeepMind
Kỹ sư AI Daniil Sheremet đã dành một tháng để tinh chỉnh Gemma 4 nhằm viết thơ Nga với nhịp điệu và vần điệu chính xác, nhưng tất cả các phiên bản tinh chỉnh đều kém hơn mô hình gốc. Thủ phạm thực sự không phải là mô hình mà là quy trình đánh giá sai lầm: một bộ chấm điểm tùy chỉnh không thể phân biệt thơ với văn xuôi, cùng với vấn đề token hóa với dấu nhấn trọng âm. Sau khi sửa bộ chấm điểm và chạy các bài kiểm tra A/B đúng cách, mô hình gốc đã thắng, làm nổi bật một bài học quan trọng về việc đánh giá đầu ra của các mô hình ngôn ngữ lớn (LLM).
Daniil Sheremet, một kỹ sư trí tuệ nhân tạo (AI) tại Agentic Lab, đã dành một tháng để khiến Gemma 4 viết thơ tiếng Nga với đúng nhịp iambic và vần điệu. Kế hoạch của anh bao gồm tinh chỉnh bằng LoRA (Low-Rank Adaptation - thích nghi hạng thấp), một hệ thống phê bình - chỉnh sửa (critic-revisor), giải mã có ràng buộc (constrained decoding) cùng nhiều kỹ thuật khác. Anh xây dựng một công cụ phân tích thơ tự chế, lấy cảm hứng từ công cụ RPST của Ilya Kozyrev, để đánh giá nhịp và vần. Anh tuyển chọn một bộ dữ liệu từ ArsPoetica, tạo ra 13.342 cặp dữ liệu huấn luyện kèm các thẻ điều khiển (control tags). Lần chạy LoRA đầu tiên (v1) tạo ra những từ vô nghĩa như 'нагосты' và 'гу́нты' do quá khớp (overfitting) và việc sử dụng dấu nhấn trong dữ liệu đích khiến các token bị phân mảnh. Lần chạy thứ hai (v2) với dữ liệu đích sạch và tốc độ học thấp hơn tạo ra những bài thơ mạch lạc hơn nhưng vẫn còn lỗi, và một thử nghiệm A/B cho thấy nó tốt hơn mô hình gốc. Tuy nhiên, hóa ra bộ chấm điểm đánh giá đã 'mù': nó không thể phân biệt thơ với văn xuôi, và mọi bảng xếp hạng trước đó đều chỉ là nhiễu. Sau khi khắc phục bộ chấm điểm bằng một công cụ gán trọng âm bằng mạng nơ-ron (RUAccent), cải thiện khả năng phát hiện vần và tái cân bằng các chỉ số đánh giá, mô hình Gemma 4 gốc đã vượt qua cả hai phiên bản đã tinh chỉnh ở cả điểm trung bình lẫn điểm tốt nhất trong 4 lần thử (best-of-4). Các mô hình tinh chỉnh đã tối ưu nhịp thơ bằng cách hy sinh vần điệu, học đúng những gì các thẻ điều khiển nhấn mạnh. Câu chuyện này nhấn mạnh tầm quan trọng của việc đánh giá vững chắc và tránh sử dụng các không gian token 'kỳ dị' khi tinh chỉnh mô hình.
Nguồn: Habr — хаб ИИ —
bản gốc
