Nghiên cứuAn toàn AI 🇷🇺 27.07.2026 13:06

6 bài học để tạo benchmark từ hướng dẫn NeurIPS

Google DeepMindGoogle DeepMind
Các tác giả của SWE-bench và GPQA tại NeurIPS đã thảo luận về những sai lầm chính khi tạo benchmark: sự chuyên chế của các chỉ số, tính chủ quan của crowdsourcing, nguy hiểm khi sử dụng LLM làm người đánh giá, và nhu cầu về các bài kiểm tra động. Lời khuyên chính — tránh các benchmark bão hòa, kiểm tra đa phương thức, và công bố kết quả với khoảng tin cậy.
Tại hội thảo NeurIPS 'The Art of Benchmarking' với sự tham gia của các tác giả của SWE-bench, GPQA và các nhà nghiên cứu từ Google DeepMind, NYU và Berkeley, đã thảo luận về các vấn đề và cạm bẫy chính trong việc tạo benchmark. Bao gồm 'chế độ ngự trị của chỉ số' (metric tyranny), nơi các chỉ số có các điểm lý tưởng cho phép mô hình 'hack' bài kiểm tra, và tương quan Pearson không phát hiện được các điểm này. Cũng lưu ý rằng sử dụng LLM làm nguồn đánh giá là nguy hiểm: chúng tương quan với con người chỉ trên tập hiệu chuẩn, và sự thiên vị bản thân dẫn đến kết quả của chính chúng bị thổi phồng. Cách tiếp cận đúng duy nhất là tạo ra các ví dụ mà mô hình thất bại. Trong số sáu sai lầm chính mà những người tạo benchmark mắc phải: tung ra benchmark với độ chính xác 70-80% trên mô hình hàng đầu (cần nhắm tới 0-1%), thiếu xác minh về tính đa phương thức thực sự của tác vụ, dựa vào lý thuyết trí thông minh của riêng mình, không lọc spam từ người dùng (tới 25% câu trả lời ngẫu nhiên), tập trung công việc vào một người làm công việc đơn lẻ, và công bố kết quả mà không có giá trị p và khoảng tin cậy. Trong tương lai, chúng ta cần các benchmark động, các nghiên cứu dọc về tác động của LLM lên con người, hiệu chuẩn kiến thức của mô hình, và các tác vụ mà một con mèo có thể giải quyết nhưng GPT không thể.
Nguồn: Хабр — Data Mining — bản gốc
Bài viết liên quan trước đây ↓
Tin mới