Yelp Luncurkan Training Orchestrator untuk Manajemen Terpadu Pelatihan Model Machine Learning
Yelp
Netflix
Yelp memperkenalkan Training Orchestrator, sebuah kerangka kerja internal yang menggantikan skrip pelatihan Spark yang terfragmentasi di seluruh tim. Framework ini menggunakan model eksekusi berbasis konfigurasi dan DAG (Directed Acyclic Graph) untuk meningkatkan reprodusibilitas, kemampuan pengujian, dan kecepatan pengembangan.
Yelp meluncurkan Training Orchestrator, sebuah kerangka kerja internal baru yang menggantikan skrip pelatihan Spark yang ditulis secara independen oleh berbagai tim. Sebelumnya, setiap tim pembelajaran mesin terapan membuat orkestrasinya sendiri, yang menyebabkan duplikasi kode, konfigurasi yang tidak konsisten, dan pemantauan kustom yang rapuh. Training Orchestrator memisahkan 'apa yang akan dijalankan' dari 'bagaimana menjalankannya' menggunakan objek konfigurasi berbasis Pydantic, yang divalidasi pada saat pembuatan untuk menghindari komputasi yang terbuang. Kerangka kerja ini membangun grafik asiklik terarah dari dependensi langkah yang dideklarasikan dan mengeksekusi langkah-langkah dalam urutan topologis. Konteks Spark/MLflow bersama memungkinkan langkah-langkah berjalan tanpa perubahan di lingkungan lokal, Jupyter, atau produksi. Validasi skema mendeteksi ketidakcocokan dalam hitungan detik, dan konfigurasi lengkap eksekusi dicatat sebagai artefak MLflow untuk reprodusibilitas. Kerangka kerja ini terintegrasi dengan platform ML Yelp, termasuk penyimpanan fitur, jaringan saraf bersama, pustaka peningkatan gradien, dan MLflow. Yelp berencana menambahkan langkah-langkah eksplisit untuk evaluasi model, perbandingan, dan penjelasan, serta pelacakan garis keturunan. Pendekatan berbasis grafik asiklik terarah ini memisahkan logika pelatihan dari runtime klaster, mendukung eksekusi lokal dan pengujian unit. Yelp mengakui adanya investasi awal dalam skema dan migrasi, tetapi percaya bahwa hal ini menghindari biaya berulang di seluruh tim.
Sumber: InfoQ 中国 —
asli
