모델애플리케이션 🇨🇳 29.07.2026 13:01

Yelp, 머신러닝 모델 훈련의 통합 관리를 위한 Training Orchestrator 출시

YelpYelp NetflixNetflix
Yelp가 Training Orchestrator를 도입했습니다. 이는 팀별로 분산된 Spark 훈련 스크립트를 대체하는 내부 프레임워크로, 설정 기반의 DAG(방향성 비순환 그래프) 기반 실행 모델을 사용하여 재현성, 테스트 가능성 및 개발 속도를 향상시킵니다.
Yelp이 Training Orchestrator를 공개했습니다. 이는 새로운 내부 프레임워크로, 각 팀이 독립적으로 작성하던 Spark 학습 스크립트를 대체합니다. 이전에는 각 응용 머신러닝 팀이 자체 오케스트레이션을 만들어 중복 코드, 일관성 없는 설정, 취약한 사용자 정의 모니터링을 초래했습니다. Training Orchestrator는 Pydantic 기반 구성 객체를 사용하여 '무엇을 실행할지'와 '어떻게 실행할지'를 분리하며, 이러한 객체는 생성 시 검증되어 불필요한 컴퓨팅을 방지합니다. 선언된 단계 종속성에서 방향성 비순환 그래프(DAG)를 구축하고 위상 정렬 순서로 단계를 실행합니다. 공유된 Spark 및 MLflow 컨텍스트 덕분에 단계를 로컬, Jupyter 또는 프로덕션 환경에서 수정 없이 실행할 수 있습니다. 스키마 검증은 수초 내에 불일치를 감지하고, 전체 실행 구성은 재현성을 위해 MLflow 아티팩트로 기록됩니다. 이 프레임워크는 Yelp의 ML 플랫폼(피처 스토어, 공유 신경망, 그래디언트 부스팅 라이브러리, MLflow 포함)과 통합됩니다. Yelp은 모델 평가, 비교, 설명을 위한 명시적 단계와 계보 추적을 추가할 계획입니다. DAG 기반 접근 방식은 학습 로직을 클러스터 런타임에서 분리하여 로컬 실행과 단위 테스트를 지원합니다. Yelp은 스키마와 마이그레이션에 초기 투자가 필요함을 인정하지만, 팀 간의 반복 비용을 피할 수 있다고 믿습니다.
출처: InfoQ 中国 — 원문
관련 게시물 ↓
새로운 뉴스