Sao chép lời nhắc của bạn hai lần: Tôi đã thử mẹo '+76%' và tìm ra sự thật
Google/DeepMind
Một mẹo vặt lan truyền cho rằng việc sao chép lời nhắc của bạn cho một mô hình ngôn ngữ lớn (LLM) giúp tăng độ chính xác lên 76%. Thử nghiệm trên 3360 truy vấn với nhiều mô hình Gemini cho thấy hiệu ứng này có thật nhưng hạn chế: nó khắc phục một lỗi cụ thể của các mô hình không suy luận với danh sách dài, chứ không phải là một sự tăng cường trí thông minh tổng quát. Con số +76% nổi tiếng là một bài kiểm tra căng thẳng đơn lẻ, và các mô hình suy luận hiện đại không bị ảnh hưởng bởi mẹo này.
Tác giả đã thử nghiệm một thủ thuật lặp lại prompt (prompt) đang gây xôn xao, được tham chiếu tới bài preprint của Google Research có tên 'Prompt Repetition Improves Non-Reasoning LLMs'. Trong nghiên cứu gốc, việc lặp lại prompt giúp cải thiện hiệu suất của các mô hình không suy luận (non-reasoning models) trong 47/70 phép so sánh, với con số +76% xuất phát từ một bài kiểm tra áp lực (stress test) duy nhất trên Gemini 2.0 Flash-Lite, mô hình mà nay đã bị ngừng hỗ trợ.
Tác giả đã tự thực hiện thí nghiệm của riêng mình: 3360 truy vấn, chi phí 1,48 USD, trên gemini-2.5-flash-lite (tắt chế độ suy luận - reasoning off) và gemini-3.5-flash-lite (ở mức suy nghĩ tối thiểu - thinking minimal và mức cao - thinking high). Trong bộ kiểm tra áp lực (gồm các tác vụ NameIndex và MiddleMatch), việc lặp lại prompt giúp tăng độ chính xác thêm 38,8 điểm phần trăm trên mô hình 2.5, tái lập được hiệu ứng ban đầu, nhưng lại không có tác dụng gì đối với các tác vụ thông thường hàng ngày. Việc thêm bản sao thứ ba chỉ mang lại thêm 5 điểm phần trăm, và việc chèn thêm một dấu hiệu như 'Repeat:' cũng không tạo ra sự khác biệt nào.
Trên mô hình 3.5 ở mức suy nghĩ tối thiểu, hiệu ứng này vẫn tồn tại (+36,3 điểm phần trăm), nhưng ở mức suy nghĩ cao, độ chính xác đã đạt 100% với cả hai loại prompt (có và không lặp lại). Thủ thuật này còn giúp ổn định một mô hình mà bình thường vốn không có tính xác định (non-deterministic).
Tuy nhiên, tác giả lưu ý rằng thủ thuật này chỉ khắc phục được cụ thể các lỗi mất tập trung khi xử lý danh sách dài, chứ không giải quyết được các vấn đề về tính toán số học hay các khiếm khuyết suy luận khác. Tác giả cũng khuyến cáo cần cẩn trọng: kết quả chỉ có giá trị trong phạm vi các phiên bản mô hình và thời điểm cụ thể được thử nghiệm, và bộ dữ liệu sử dụng là do tác giả tự tạo ra.
Nguồn: Habr — хаб ИИ —
bản gốc
