Amazon SageMaker Python SDK integreert optimalisatietools voor grote taalmodellen
Amazon Web Services
De Amazon SageMaker Python SDK v3 bevat nu aanbevelingen voor generatieve AI-inferentie, waardoor gebruikers endpoints kunnen benchmarken, implementatieaanbevelingen kunnen genereren en rechtstreeks vanuit notebooks kunnen implementeren. De nieuwe mogelijkheden, beschikbaar onder het pakket sagemaker.serve.ai_inference_recommender, automatiseren de optimalisatie van inferentie en integreren met bestaande workflows.
De Amazon SageMaker Python SDK v3 introduceert aanbevelingen voor generatieve AI-inferentie, waarmee gebruikers de implementatie van grote taalmodellen kunnen optimaliseren. De service benchmarkt live endpoints op basis van synthetisch of echt verkeer, meet doorvoer, tijd tot eerste token (TTFT) en latentie, en genereert gerangschikte implementatie-aanbevelingen op basis van kosten-prestatie-afwegingen. Gebruikers kunnen de hoogst gerangschikte configuratie rechtstreeks implementeren op een Amazon SageMaker real-time endpoint. De nieuwe SDK-interface, beschikbaar in het sagemaker.serve.ai_inference_recommender-pakket vanaf versie 3.17.0, bevat bewerkingen zoals ModelBuilder.from_jumpstart_config, start_benchmark, generate_deployment_recommendations en deploy. Het artikel demonstreert een end-to-end werkstroom: het genereren van aanbevelingen, het interpreteren van resultaten, het implementeren, het benchmarken en het vergelijken van frameworks zoals LMI en vLLM. Het legt ook uit hoe je belangrijke statistieken leest en hoe je kiest tussen configuraties op basis van prestatiedoelen, en hoe je implementeert vanuit een eerder uitgevoerde aanbevelingsopdracht met behulp van ModelBuilder.from_recommendation_job.
Bron: AWS ML blog —
origineel
