ハードウェア・推論 🇺🇸 06.08.2026 21:04

Amazon SageMaker Python SDKがLLM最適化ツールを統合

Amazon Web ServicesAmazon Web Services
Amazon SageMaker Python SDK v3には、生成AI推論の推奨事項が含まれるようになり、ユーザーはエンドポイントのベンチマーク、デプロイメント推奨事項の生成、ノートブックからの直接デプロイが可能になりました。新機能はsagemaker.serve.ai_inference_recommenderパッケージで利用でき、推論最適化を自動化し、既存のワークフローと統合します。
Amazon SageMaker Python SDK v3では、生成AI推論レコメンデーションが導入され、大規模言語モデルのデプロイを最適化できるようになりました。このサービスは、ライブエンドポイントを合成トラフィックまたは実際のトラフィックに対してベンチマークし、スループット、最初のトークンまでの時間(TTFT)、レイテンシーを測定し、コストとパフォーマンスのトレードオフに基づいてランク付けされたデプロイメント推奨事項を生成します。ユーザーは、最上位の構成を直接Amazon SageMakerリアルタイムエンドポイントにデプロイできます。バージョン3.17.0以降のsagemaker.serve.ai_inference_recommenderパッケージで利用可能な新しいSDKインターフェースには、ModelBuilder.from_jumpstart_config、start_benchmark、generate_deployment_recommendations、deployなどのオペレーションが含まれています。この投稿では、推奨事項の生成、結果の解釈、デプロイ、ベンチマーク、LMIやvLLMなどのフレームワークの比較というエンドツーエンドのワークフローを示しています。また、主要なメトリクスの読み方、パフォーマンス目標に基づく構成の選択方法、以前に実行した推奨ジョブからModelBuilder.from_recommendation_jobを使用してデプロイする方法についても説明しています。
出典: AWS ML blog — 原文
関連記事 ↓
新着ニュース