硬件与推理 🇺🇸 06.08.2026 21:04

Amazon SageMaker Python SDK 集成 LLM 优化工具

Amazon Web ServicesAmazon Web Services
Amazon SageMaker Python SDK v3 现在包含生成式 AI 推理建议,允许用户从笔记本直接对端点进行基准测试、生成部署建议并进行部署。新功能位于 sagemaker.serve.ai_inference_recommender 包下,可自动化推理优化并集成到现有工作流中。
Amazon SageMaker Python SDK v3 引入了生成式 AI 推理建议,使用户能够优化大型语言模型的部署。该服务针对实时端点,使用合成流量或真实流量进行基准测试,衡量吞吐量、首令牌时间(TTFT)和延迟,并根据成本-性能权衡生成排序的部署建议。用户可以将排名靠前的配置直接部署到 Amazon SageMaker 实时端点。新的 SDK 接口位于 sagemaker.serve.ai_inference_recommender 包中,从版本 3.17.0 开始可用,包括 ModelBuilder.from_jumpstart_config、start_benchmark、generate_deployment_recommendations 和 deploy 等操作。该文章演示了端到端的工作流程:生成建议、解读结果、部署、基准测试,以及比较 LMI 和 vLLM 等框架。它还解释了如何阅读关键指标,如何根据性能目标在配置之间进行选择,以及如何使用 ModelBuilder.from_recommendation_job 从先前运行的建议任务中部署。
来源: AWS ML blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻