하드웨어 및 추론 🇺🇸 06.08.2026 21:04

아마존 SageMaker 파이썬 SDK, LLM 최적화 도구 통합

Amazon Web ServicesAmazon Web Services
아마존 SageMaker 파이썬 SDK v3에는 이제 생성형 AI 추론 권장 사항이 포함되어, 사용자가 엔드포인트를 벤치마킹하고, 배포 권장 사항을 생성하며, 노트북에서 직접 배포할 수 있습니다. sagemaker.serve.ai_inference_recommender 패키지에서 제공되는 새로운 기능은 추론 최적화를 자동화하고 기존 워크플로우와 통합됩니다.
Amazon SageMaker Python SDK v3는 생성형 AI 추론 권장 사항을 도입하여 대규모 언어 모델의 배포를 최적화할 수 있게 해줍니다. 이 서비스는 라이브 엔드포인트를 합성 또는 실제 트래픽에 대해 벤치마킹하고, 처리량(throughput), 첫 번째 토큰까지의 시간(time-to-first-token, TTFT), 지연 시간(latency)을 측정하며, 비용 대비 성능 트레이드오프를 기반으로 순위가 매겨진 배포 권장 사항을 생성합니다. 사용자는 최상위 순위 구성 구성을 Amazon SageMaker 실시간 엔드포인트에 직접 배포할 수 있습니다. 버전 3.17.0부터 제공되는 sagemaker.serve.ai_inference_recommender 패키지의 새로운 SDK 인터페이스에는 ModelBuilder.from_jumpstart_config, start_benchmark, generate_deployment_recommendations, deploy와 같은 작업이 포함됩니다. 이 게시물은 권장 사항 생성, 결과 해석, 배포, 벤치마킹, 그리고 LMI 및 vLLM과 같은 프레임워크 비교를 포함한 엔드투엔드 워크플로우를 보여줍니다. 또한 주요 지표를 읽고 성능 목표에 따라 구성 간에 선택하는 방법과 ModelBuilder.from_recommendation_job을 사용하여 이전에 실행한 권장 작업에서 배포하는 방법도 설명합니다.
출처: AWS ML blog — 원문
관련 게시물 ↓
새로운 뉴스