내 모델이 작동하지 않는 이유는?
이 기사에서는 실제 애플리케이션에서 모델이 실패하게 만드는 머신러닝의 일반적인 함정을 논의합니다. 테스트 중에는 좋아 보이지만 실제로는 문제가 발생합니다. 주요 문제로는 오해의 소지가 있는 데이터 (숨겨진 변수, 가짜 상관관계, 레이블링 오류), 데이터 유출 (분할 전 전처리, 선견 편향, 반복적인 테스트 세트 과적합), 부적절한 메트릭 선택 (예: 불균형 데이터에서의 정확도) 등이 있습니다. 저자는 REFORMS 체크리스트와 돌출 맵, 다양한 벤치마크, 적절한 데이터 분할과 같은 관행을 통해 모델 신뢰성을 개선할 것을 권장합니다.
이 기사는 저자의 20년 머신러닝 경험과 논문 '머신러닝 함정 피하는 방법: 학술 연구자를 위한 안내서'를 바탕으로, 모델이 실제 환경에서 실패하는 일반적인 실수들을 설명합니다. 첫째, 오해의 소지가 있는 데이터: 숨겨진 변수(예: 코로나19 흉부 스캔에서의 신체 방향)와 가짜 상관관계(예: 탱크 이미지에서의 배경 픽셀)로 인해 모델이 관련 없는 패턴을 학습합니다. 적대적 공격은 이러한 가짜 상관관계를 악용합니다. 몇 퍼센트에 불과한 레이블링 오류도 벤치마크 비교를 왜곡할 수 있습니다. 둘째, 데이터 누출: 데이터 분할 전에 전체 데이터셋에 대해 데이터 의존적 전처리(중심화, 스케일링, 특성 선택, 데이터 증강)를 수행하면 정보가 유출되어 성능이 부풀려집니다. 시계열 예측에서의 선견지명 편향과 테스트 세트에 대한 반복적 과적합(테스트 세트에 맞춰 훈련)이 일반적인 누출 사례입니다. 셋째, 부적절한 지표: 불균형 데이터에 정확도를 사용하면 오해의 소지가 있습니다. 저자는 머신러닝 기반 과학을 위한 REFORMS 체크리스트와 중요도 맵 검토, 여러 벤치마크 사용, 적절한 데이터 분할 보장과 같은 관행을 권장합니다.
출처: The Gradient —
원문
