Почему моя модель не работает?
В статье рассматриваются типичные ошибки машинного обучения, из-за которых модели терпят неудачу в реальных приложениях, несмотря на хорошие результаты при тестировании. Ключевые проблемы включают вводящие в заблуждение данные (скрытые переменные, ложные корреляции, ошибки разметки), утечку данных (предобработка перед разделением, предвзятость заглядывания вперед, итеративное переобучение на тестовом наборе) и неправильный выбор метрик (например, точность на несбалансированных данных). Автор рекомендует контрольный список REFORMS и такие практики, как использование карт значимости, разнообразных бенчмарков и правильное разделение данных для повышения надежности моделей.
Статья, основанная на 20-летнем опыте автора в области машинного обучения и статье «Как избежать ловушек машинного обучения: руководство для академических исследователей», описывает распространенные ошибки, приводящие к сбоям моделей в продакшене. Во-первых, вводящие в заблуждение данные: скрытые переменные (например, ориентация тела на снимках грудной клетки при Covid) и ложные корреляции
Показать ещё ↓
Источник: The Gradient —
оригинал
