Le SDK Python d'Amazon SageMaker Intègre des Outils d'Optimisation pour Grands Modèles de Langage
Amazon Web Services
La version 3 du SDK Python d'Amazon SageMaker inclut désormais des recommandations d'inférence pour l'IA générative, permettant aux utilisateurs de comparer les performances des points de terminaison, de générer des recommandations de déploiement et de déployer directement depuis des notebooks. Ces nouvelles fonctionnalités, disponibles sous le package sagemaker.serve.ai_inference_recommender, automatisent l'optimisation de l'inférence et s'intègrent aux flux de travail existants.
Le SDK Python v3 d'Amazon SageMaker introduit des recommandations d'inférence générative, permettant aux utilisateurs d'optimiser le déploiement de grands modèles de langage. Le service évalue les points de terminaison en direct par rapport à un trafic synthétique ou réel, mesure le débit, le temps jusqu'au premier jeton (TTFT) et la latence, et génère des recommandations de déploiement classées en fonction des compromis coût-performance. Les utilisateurs peuvent déployer la configuration la mieux classée directement sur un point de terminaison en temps réel Amazon SageMaker. La nouvelle interface SDK, disponible dans le package sagemaker.serve.ai_inference_recommender à partir de la version 3.17.0, inclut des opérations telles que ModelBuilder.from_jumpstart_config, start_benchmark, generate_deployment_recommendations et deploy. L'article démontre un flux de travail de bout en bout : génération de recommandations, interprétation des résultats, déploiement, évaluation comparative et comparaison de frameworks comme LMI et vLLM. Il explique également comment lire les métriques clés et choisir entre les configurations en fonction des objectifs de performance, ainsi que comment déployer à partir d'un travail de recommandation précédemment exécuté à l'aide de ModelBuilder.from_recommendation_job.
Source: AWS ML blog —
original
