오픈 소스연구 🇷🇺 13.08.2026 13:03

러시아 과학자들, AI 모델 훈련 전 데이터 검증 도구 개발

СберСбер СбербанкСбербанк
Sberbank의 실용 인공지능 센터와 AIRI 연구소의 과학자들이 SplitLight라는 오픈소스 도구를 선보였습니다. 이 도구는 훈련 전 데이터를 진단하고 추천 모델을 비교하는 데 사용되며, 이상 징후를 감지하고 결과의 비교 가능성을 보장하며 현실성을 확인하여 비효율적인 모델을 배포할 위험을 줄여줍니다.
Sberbank 실용 인공지능 센터와 AIRI 연구소의 과학자들이 추천 모델을 훈련하고 비교하기 전에 데이터 진단을 위한 오픈소스 도구인 SplitLight를 발표했습니다. 추천 시스템은 전자상거래, 비디오 서비스, 콘텐츠 플랫폼에서 널리 사용되며, 기업들은 어떤 모델을 개발할지 결정하기 위해 실험에 의존합니다. 그러나 훈련 데이터가 제대로 준비되지 않거나 실험 조건이 실제 환경과 다르면 팀은 적절하지 않은 솔루션을 선택하고 자원을 낭비할 수 있습니다. SplitLight는 조기 데이터 점검을 가능하게 하고 실험 결과의 실용적 적용 가능성을 평가하여 이러한 위험을 줄입니다. 이 도구는 무료로 제공되며 Python 라이브러리 또는 대화형 웹 인터페이스로 사용할 수 있습니다. 이 도구의 주요 목표는 지표를 왜곡할 수 있는 로깅 실패, 이동된 타임스탬프, 중복 이벤트와 같은 보이지 않는 문제를 보이게 만드는 것입니다. 또한 연구 간 비교 불가능성 문제를 해결하여 팀이 재현성을 위해 핵심 통계를 고정할 수 있게 합니다. 또한 미래로부터의 데이터 누출을 식별하고, 새 사용자와 아이템을 고려하며, 훈련 세트와 검증 세트 간의 차이를 평가하여 현실성을 확인합니다. Alexey Vasiliev가 이끄는 프로젝트 팀은 여섯 개의 인기 있는 공개 데이터 세트에서 SplitLight를 테스트하여 분할의 사소한 변경도 지표에 상당한 영향을 미칠 수 있음을 보여주었습니다. Sberbank의 선임 상무이사이자 AI 변혁 책임자인 Sergey Ryabov는 SplitLight가 마켓플레이스, 스트리밍, 미디어에서 제품 팀에게 신뢰할 수 있는 보호를 제공하고 연구 그룹의 문서화와 비교를 단순화한다고 언급했습니다. 소스 코드는 러시아 플랫폼 GitVerse와 GitHub에서 사용할 수 있습니다.
출처: CNews — 원문
관련 게시물 ↓
새로운 뉴스