Yelp、機械学習モデルトレーニングの一元管理を実現するTraining Orchestratorを発表
Yelp
Netflix
Yelpは、チーム間で断片化していたSparkトレーニングスクリプトを置き換える内部フレームワーク「Training Orchestrator」を導入した。これは設定ベースのDAG駆動実行モデルを採用し、再現性、テスト容易性、開発速度を向上させる。
Yelpは、各チームが個別に作成していたSparkトレーニングスクリプトに代わる新しい内部フレームワーク「Training Orchestrator」を発表しました。これまで各応用機械学習チームが独自のオーケストレーションを構築していたため、コードの重複、設定の不整合、脆弱なカスタム監視が生じていました。Training Orchestratorでは、「何を実行するか」と「どのように実行するか」を分離し、Pydanticベースの設定オブジェクトを使用します。これらのオブジェクトは作成時に検証されるため、無駄な計算リソースの消費を防ぎます。宣言されたステップの依存関係から有向非巡回グラフ(DAG)を構築し、トポロジカル順序でステップを実行します。共有されたSpark/MLflowコンテキストにより、ステップはローカル環境、Jupyter環境、プロダクション環境で変更なしに実行できます。スキーマ検証により不一致を数秒で検出し、完全な実行設定は再現性のためにMLflowアーティファクトとして記録されます。このフレームワークはYelpのMLプラットフォーム(特徴量ストア、共有ニューラルネットワーク、勾配ブースティングライブラリ、MLflowなど)と統合されています。Yelpは、モデル評価、比較、説明のための明示的なステップや、系列追跡を追加する予定です。DAGベースのアプローチにより、トレーニングロジックをクラスタランタイムから切り離し、ローカル実行や単体テストをサポートします。Yelpはスキーマと移行への初期投資が必要であることを認めつつも、チーム全体での繰り返しコストを回避できると考えています。
出典: InfoQ 中国 —
原文
