Nghiên cứuMô hình 🇷🇺 31.07.2026 16:01

Ghi nhớ so với khái quát hóa: mô hình ngôn ngữ 2160 tham số thực sự làm được gì

Thí nghiệm với mô hình ngôn ngữ siêu nhỏ 2160 tham số cho thấy khả năng ghi nhớ tự tin các mẫu đã học (xác suất token 99,93%), chuyển giao hạn chế khi hoán vị token quen thuộc (81,69%) và thất bại với cấu trúc câu hỏi mới (10,46%). Mô hình giữ được toàn bộ 14 mối quan hệ ban đầu mà không bị catastrophic forgetting.
Trong phiên bản 1.1.0 của dự án Tiny Language Model trên Node.js, sau khi thảo luận trong cộng đồng ML và nhận phản hồi từ các kỹ sư trên Hashnode, đã bổ sung nghiên cứu ranh giới giữa ghi nhớ và khái quát hóa. Với seed cố định là 42, đã tiến hành đánh giá đông cứng (frozen evaluation) gồm bốn bài kiểm tra: mẫu đã huấn luyện chính xác, token quen thuộc theo thứ tự mới, mẫu hoàn toàn tách biệt (held-out) và duy trì 14 mối quan hệ sau adaptive SFT. Kết quả cho thấy, trên mẫu quen thuộc, xác suất tối thiểu của token đúng là 99.93%; với phép hoán vị token là 81.69%; còn với cấu trúc câu hỏi không xác định chỉ đạt 10.46%, trong đó mô hình trả lời 'cat can fly' thay vì 'cat cannot read' như mong đợi. Nhiệm vụ duy trì mối quan hệ được hoàn thành hoàn toàn (14/14, độ chính xác 100%). Thí nghiệm cho thấy ranh giới khả năng của mô hình nằm giữa ghi nhớ và chuyển dịch cục bộ so với khái quát hóa thực sự: mô hình tái tạo tốt những gì đã học và xử lý được các thay đổi nhỏ, nhưng cấu trúc mới làm hỏng hành vi. Nguyên nhân hạn chế không chỉ ở số lượng tham số mà còn ở kho ngữ liệu nhỏ với số lượng cấu trúc hạn chế. Tác giả lưu ý rằng việc tăng số neuron hoặc số khối mà không có dữ liệu đa dạng hơn chỉ cải thiện khả năng ghi nhớ. Đây là một bài chẩn đoán học tập có thể tái lập, không phải là một benchmark hoàn chỉnh.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới