俄罗斯科学家打造AI模型训练前数据验证工具
Сбер
Сбербанк
来自Sberbank实用人工智能中心和AIRI研究所的科学家们推出了SplitLight,这是一款开源工具,用于在训练前诊断数据并比较推荐模型。该工具能检测异常、确保结果的可比性并检查现实性,从而降低部署无效模型的风险。
Sberbank实用人工智能中心与AIRI研究所的科学家展示了SplitLight,这是一款在训练和比较推荐模型之前进行数据诊断的开源工具。推荐系统广泛应用于电子商务、视频服务和内容平台,公司依赖实验来决定开发哪些模型。然而,如果训练数据准备不当或实验条件与现实脱节,团队可能会选择不合适的解决方案并浪费资源。SplitLight通过允许早期数据检查并评估实验结果的实际适用性来降低这一风险。它是免费提供的,可以用作Python库或交互式网页界面。该工具的主要目标是让隐形问题显形,例如可能导致指标扭曲的日志记录故障、时间戳偏移和重复事件。它还解决了研究之间可比性的问题,使团队能够固定关键统计量以实现可复现性。此外,它通过识别来自未来的数据泄漏、考虑新用户和新物品以及评估训练集与验证集之间的差异来检查现实性。由Alexey Vasiliev领导的团队在六个流行的开放数据集上测试了SplitLight,表明即使拆分方式的微小变化也可能显著影响指标。Sberbank高级董事总经理兼人工智能转型总监Sergey Ryabov指出,SplitLight为市场、流媒体和媒体领域的产品团队提供了可靠的保护,并简化了研究小组的文档和比较工作。源代码可在俄罗斯平台GitVerse和GitHub上获取。
来源: CNews —
原文
