Yelp 推出 Training Orchestrator,统一管理机器学习模型训练
Yelp
Netflix
Yelp 推出了 Training Orchestrator,这是一个内部框架,取代了各团队零散的 Spark 训练脚本。它采用基于配置、有向无环图驱动的执行模型,提高了可重复性、可测试性和开发速度。
Yelp 推出了 Training Orchestrator,这是一个新的内部框架,用于替代各团队独立编写的 Spark 训练脚本。此前,每个应用机器学习团队都自行构建编排逻辑,导致代码重复、配置不一致以及脆弱的自定义监控。Training Orchestrator 通过基于 Pydantic 的配置对象将“运行内容”与“运行方式”分离,这些配置在创建时即进行验证,以避免计算资源浪费。它根据声明的步骤依赖关系构建有向无环图(DAG),并按拓扑顺序执行步骤。共享的 Spark/MLflow 上下文允许步骤在本地、Jupyter 或生产环境中无需修改即可运行。模式验证可在数秒内捕获不匹配问题,完整的运行配置作为 MLflow 工件记录,以确保可重现性。该框架与 Yelp 的机器学习平台集成,包括特征存储、共享神经网络、梯度提升库和 MLflow。Yelp 计划增加用于模型评估、比较和解释的显式步骤,以及血缘追踪。基于 DAG 的方法将训练逻辑与集群运行时解耦,支持本地运行和单元测试。Yelp 承认在模式和迁移方面需要前期投入,但相信这能避免各团队的重复成本。
来源: InfoQ 中国 —
原文
