Tại sao mô hình của tôi không hoạt động?
Bài viết thảo luận về các cạm bẫy phổ biến trong học máy khiến mô hình thất bại trong ứng dụng thực tế dù có vẻ tốt trong quá trình kiểm tra. Các vấn đề chính bao gồm dữ liệu sai lệch (biến ẩn, tương quan giả, lỗi gán nhãn), rò rỉ dữ liệu (tiền xử lý trước khi chia, thiên vị nhìn về tương lai, quá khớp tập kiểm tra lặp đi lặp lại), và lựa chọn chỉ số không phù hợp (ví dụ: độ chính xác trên dữ liệu mất cân bằng). Tác giả đề xuất danh sách kiểm tra REFORMS và các thực hành như sử dụng bản đồ nổi bật, chuẩn đa dạng và phân chia dữ liệu hợp lý để cải thiện độ tin cậy của mô hình.
Bài báo này, dựa trên 20 năm kinh nghiệm về học máy của tác giả và bài báo 'How to avoid machine learning pitfalls: a guide for academic researchers', phác thảo những sai lầm phổ biến dẫn đến mô hình thất bại trong quá trình sản xuất. Thứ nhất, dữ liệu gây hiểu lầm: các biến ẩn (ví dụ: hướng cơ thể trong ảnh chụp CT Covid) và các tương quan giả (ví dụ: pixel nền trong ảnh xe tăng) khiến mô hình học các mẫu không liên quan. Các cuộc tấn công đối nghịch khai thác các tương quan giả này. Lỗi gán nhãn, dù chỉ vài phần trăm, có thể làm sai lệch so sánh điểm chuẩn. Thứ hai, rò rỉ dữ liệu: thực hiện tiền xử lý phụ thuộc vào dữ liệu (căn giữa, chia tỷ lệ, chọn đặc trưng, tăng cường dữ liệu) trên toàn bộ tập dữ liệu trước khi tách dữ liệu kiểm tra sẽ làm rò rỉ thông tin, làm tăng hiệu suất. Độ lệch nhìn về phía trước trong dự báo chuỗi thời gian và việc khớp quá mức lặp đi lặp lại trên tập kiểm tra (huấn luyện theo tập kiểm tra) là những rò rỉ phổ biến. Thứ ba, chỉ số không phù hợp: sử dụng độ chính xác trên dữ liệu mất cân bằng có thể gây hiểu lầm. Tác giả khuyến nghị danh sách kiểm tra REFORMS cho khoa học dựa trên học máy và các thực hành như kiểm tra bản đồ độ nổi bật, sử dụng nhiều điểm chuẩn và đảm bảo phân chia dữ liệu hợp lý.
Nguồn: The Gradient —
bản gốc
