Amazon SageMaker Python SDK интегрирует инструменты оптимизации больших языковых моделей
Amazon SageMaker Python SDK версии 3 теперь включает рекомендации по инференсу генеративного ИИ, позволяя пользователям проводить бенчмаркинг конечных точек, генерировать рекомендации по развертыванию и развертывать модели непосредственно из блокнотов. Новые возможности, доступные в пакете sagemaker.serve.ai_inference_recommender, автоматизируют оптимизацию инференса и интегрируются с существующими рабочими процессами.
Amazon SageMaker Python SDK v3 представляет рекомендации по инференсу генеративного ИИ, позволяя пользователям оптимизировать развертывание больших языковых моделей. Сервис проводит бенчмаркинг живых конечных точек на синтетическом или реальном трафике, измеряет пропускную способность, время до первого токена (TTFT) и задержку, а также формирует ранжированные рекомендации по развертыванию на
Показать ещё ↓
Источник: AWS ML blog —
оригинал
