Open SourceRecherche 🇷🇺 13.08.2026 13:03

Des scientifiques russes créent un outil de validation des données avant l'entraînement des modèles d'IA

СберСбер СбербанкСбербанк
Des scientifiques du Centre d'intelligence artificielle pratique de Sberbank et de l'Institut AIRI ont présenté SplitLight, un outil open-source permettant de diagnostiquer les données avant l'entraînement et de comparer les modèles de recommandation. L'outil détecte les anomalies, garantit la comparabilité des résultats et vérifie le réalisme, réduisant ainsi le risque de déployer des modèles inefficaces.
Des scientifiques du Centre d'intelligence artificielle pratique de la Sberbank et de l'Institut AIRI ont présenté SplitLight, un outil open-source pour le diagnostic des données avant l'entraînement et la comparaison des modèles de recommandation. Les systèmes de recommandation sont largement utilisés dans le commerce électronique, les services vidéo et les plateformes de contenu, et les entreprises s'appuient sur des expériences pour décider quels modèles développer. Cependant, si les données d'entraînement sont mal préparées ou si les conditions expérimentales divergent de la réalité, les équipes peuvent choisir des solutions inadaptées et gaspiller des ressources. SplitLight réduit ce risque en permettant des vérifications précoces des données et en évaluant l'applicabilité pratique des résultats expérimentaux. Il est disponible gratuitement et peut être utilisé comme bibliothèque Python ou comme interface web interactive. L'objectif principal de l'outil est de rendre visibles les problèmes invisibles, tels que les défaillances de journalisation, les décalages de timestamps et les événements dupliqués qui peuvent fausser les métriques. Il aborde également la question de l'incomparabilité entre les études, permettant aux équipes de fixer des statistiques clés pour la reproductibilité. De plus, il vérifie le réalisme en identifiant les fuites de données provenant du futur, en tenant compte des nouveaux utilisateurs et articles, et en évaluant les différences entre les ensembles d'entraînement et de validation. L'équipe du projet, dirigée par Alexey Vasiliev, a testé SplitLight sur six ensembles de données ouverts populaires, démontrant que même des changements mineurs dans la répartition peuvent affecter considérablement les métriques. Sergey Ryabov, directeur général principal et directeur de la transformation de l'IA à la Sberbank, a noté que SplitLight offre une protection fiable pour les équipes produit dans les marketplaces, le streaming et les médias, et simplifie la documentation et la comparaison pour les groupes de recherche. Le code source est disponible sur la plateforme russe GitVerse et sur GitHub.
Source: CNews — original
Nos articles précédents sur ce sujet ↓
Infos fraîches