модели развивать. Однако если данные для обучения подготовлены плохо или условия экспериментов расходятся с реальной жизнью, команды могут выбрать неподходящие решения и потратить ресурсы впустую. SplitLight снижает этот риск, позволяя проводить ранние проверки данных и оценивать практическую применимость результатов экспериментов. Он доступен бесплатно и может использоваться как библиотека Python или как интерактивный веб-интерфейс. Основная цель инструмента — сделать видимыми невидимые проблемы, такие как сбои в логировании, смещенные временные метки и дублирующиеся события, которые могут искажать метрики. Он также решает проблему несопоставимости исследований, позволяя командам фиксировать ключевые статистики для воспроизводимости. Кроме того, он проверяет реалистичность, выявляя утечки данных из будущего, учитывая новых пользователей и объекты, а также оценивая различия между обучающей и валидационной выборками. Команда проекта под руководством Алексея Васильева протестировала SplitLight на шести популярных открытых наборах данных, показав, что даже незначительные изменения в разбиении могут существенно повлиять на метрики. Сергей Рябов, старший управляющий директор и директор по трансформации ИИ Сбербанка, отметил, что SplitLight обеспечивает надежную защиту для продуктовых команд на маркетплейсах, в стриминговых сервисах и медиа, а также упрощает документирование и сравнение для исследовательских групп. Исходный код доступен на российской платформе GitVerse и на GitHub.