Hardware e Inferencia 🇺🇸 06.08.2026 21:04

El SDK de Python de Amazon SageMaker Integra Herramientas de Optimización de Modelos de Lenguaje de Gran Tamaño

Amazon Web ServicesAmazon Web Services
El SDK de Python de Amazon SageMaker v3 ahora incluye recomendaciones de inferencia de IA generativa, lo que permite a los usuarios evaluar el rendimiento de los endpoints, generar recomendaciones de implementación y desplegar directamente desde los notebooks. Las nuevas capacidades, disponibles bajo el paquete sagemaker.serve.ai_inference_recommender, automatizan la optimización de la inferencia y se integran con los flujos de trabajo existentes.
El Amazon SageMaker Python SDK v3 introduce recomendaciones de inferencia de IA generativa, lo que permite a los usuarios optimizar la implementación de modelos de lenguaje de gran tamaño. El servicio evalúa puntos de conexión en vivo contra tráfico sintético o real, mide el rendimiento, el tiempo hasta el primer token (TTFT) y la latencia, y genera recomendaciones de implementación clasificadas según las compensaciones entre costo y rendimiento. Los usuarios pueden implementar la configuración mejor clasificada directamente en un punto de conexión en tiempo real de Amazon SageMaker. La nueva interfaz del SDK, disponible en el paquete sagemaker.serve.ai_inference_recommender a partir de la versión 3.17.0, incluye operaciones como ModelBuilder.from_jumpstart_config, start_benchmark, generate_deployment_recommendations y deploy. La publicación demuestra un flujo de trabajo de extremo a extremo: generar recomendaciones, interpretar resultados, implementar, evaluar y comparar marcos como LMI y vLLM. También explica cómo leer métricas clave y elegir entre configuraciones según los objetivos de rendimiento, y cómo implementar desde un trabajo de recomendación ejecutado previamente usando ModelBuilder.from_recommendation_job.
Fuente: AWS ML blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas