Integração de ferramentas de otimização de LLMs no Amazon SageMaker Python SDK
Amazon Web Services
O Amazon SageMaker Python SDK v3 agora inclui recomendações de inferência para IA generativa, permitindo que os usuários avaliem endpoints, gerem recomendações de implantação e implantem diretamente dos notebooks. As novas funcionalidades, disponíveis sob o pacote sagemaker.serve.ai_inference_recommender, automatizam a otimização de inferência e integram-se aos fluxos de trabalho existentes.
O Amazon SageMaker Python SDK v3 introduz recomendações de inferência de IA generativa, permitindo aos usuários otimizar a implantação de modelos de linguagem de grande porte. O serviço avalia endpoints ao vivo contra tráfego sintético ou real, mede throughput, tempo até o primeiro token (TTFT, na sigla em inglês) e latência, e gera recomendações de implantação classificadas com base em compensações entre custo e desempenho. Os usuários podem implantar a configuração mais bem classificada diretamente em um endpoint em tempo real do Amazon SageMaker. A nova interface do SDK, disponível no pacote sagemaker.serve.ai_inference_recommender a partir da versão 3.17.0, inclui operações como ModelBuilder.from_jumpstart_config, start_benchmark, generate_deployment_recommendations e deploy. O post demonstra um fluxo de trabalho de ponta a ponta: gerar recomendações, interpretar resultados, implantar, avaliar benchmarks e comparar frameworks como LMI e vLLM. Ele também explica como ler as principais métricas e escolher entre configurações com base em metas de desempenho, e como implantar a partir de um job de recomendação executado anteriormente usando ModelBuilder.from_recommendation_job.
Fonte: AWS ML blog —
original
