ロシアの科学者、AIモデルトレーニング前のデータ検証ツールを開発
Сбер
Сбербанк
ズベルバンク実用人工知能センターとAIRI研究所の科学者らが、トレーニング前のデータ診断とレコメンダーモデルの比較を行うためのオープンソースツール「SplitLight」を発表しました。このツールは異常を検出し、結果の比較可能性を確保し、現実性をチェックすることで、効果のないモデルを導入するリスクを低減します。
Sberbankの実用人工知能センターとAIRI研究所の科学者たちは、レコメンダーモデルのトレーニング前のデータ診断と比較のためのオープンソースツール「SplitLight」を発表した。レコメンダーシステムは、電子商取引、ビデオサービス、コンテンツプラットフォームで広く使用されており、企業はどのモデルを開発するかを決定するために実験に依存している。しかし、トレーニングデータの準備が不十分であったり、実験条件が実際の状況と異なっていたりすると、チームは不適切なソリューションを選択し、リソースを無駄にする可能性がある。SplitLightは、早期のデータチェックを可能にし、実験結果の実用性を評価することで、このリスクを軽減する。これは無料で利用でき、PythonライブラリまたはインタラクティブなWebインターフェースとして使用できる。このツールの主な目的は、ログの失敗、タイムスタンプのずれ、指標を歪める可能性のある重複イベントなど、目に見えない問題を可視化することである。また、研究間の比較不能性という問題にも対処し、チームが再現性のために主要な統計を固定できるようにする。さらに、将来からのデータ漏洩を特定し、新しいユーザーやアイテムを考慮し、トレーニングセットとバリデーションセットの違いを評価することで、現実性をチェックする。アレクセイ・ワシリエフ率いるプロジェクトチームは、6つの人気のあるオープンデータセットでSplitLightをテストし、分割のわずかな変更が指標に大きな影響を与える可能性があることを実証した。Sberbankの上級常務取締役兼AI変革ディレクターであるセルゲイ・リャボフ氏は、SplitLightがマーケットプレイス、ストリーミング、メディアのプロダクトチームに信頼できる保護を提供し、研究グループの文書化と比較を簡素化すると述べた。ソースコードはロシアのプラットフォームGitVerseとGitHubで入手可能である。
出典: CNews —
原文
