Amazon SageMaker Python SDK Integrasikan Alat Optimasi LLM
Amazon Web Services
Amazon SageMaker Python SDK versi 3 kini menyertakan rekomendasi inferensi AI generatif, yang memungkinkan pengguna untuk melakukan benchmark endpoint, menghasilkan rekomendasi penempatan, dan men-deploy langsung dari notebook. Kemampuan baru ini, tersedia dalam paket sagemaker.serve.ai_inference_recommender, mengotomatiskan optimasi inferensi dan terintegrasi dengan alur kerja yang ada.
Amazon SageMaker Python SDK v3 memperkenalkan rekomendasi inferensi AI generatif, yang memungkinkan pengguna untuk mengoptimalkan penerapan model bahasa besar. Layanan ini melakukan benchmark titik akhir langsung terhadap lalu lintas sintetis atau nyata, mengukur throughput, waktu ke token pertama (TTFT), dan latensi, serta menghasilkan rekomendasi penerapan yang diperingkat berdasarkan trade-off biaya-kinerja. Pengguna dapat menerapkan konfigurasi peringkat teratas langsung ke titik akhir real-time Amazon SageMaker. Antarmuka SDK baru, tersedia dalam paket sagemaker.serve.ai_inference_recommender mulai versi 3.17.0, mencakup operasi seperti ModelBuilder.from_jumpstart_config, start_benchmark, generate_deployment_recommendations, dan deploy. Postingan ini menunjukkan alur kerja ujung-ke-ujung: membuat rekomendasi, menafsirkan hasil, menerapkan, melakukan benchmark, dan membandingkan kerangka kerja seperti LMI dan vLLM. Ini juga menjelaskan cara membaca metrik utama dan memilih antara konfigurasi berdasarkan target kinerja, dan cara menerapkan dari pekerjaan rekomendasi yang dijalankan sebelumnya menggunakan ModelBuilder.from_recommendation_job.
Sumber: AWS ML blog —
asli
