миллион токенов и является мультимодальной (текст и изображения). Веса доступны на Hugging Face в формате MXFP4, для инференса рекомендуется vLLM. Для развертывания требуются инстансы p6-b300 с 8 GPU NVIDIA B300 Blackwell Ultra. AWS предлагает два способа: SageMaker HyperPod с Inference Operator и автономный Amazon EKS с использованием Capacity Blocks. Оба способа обеспечивают OpenAI-совместимый API для вызовов. Статья содержит подробные шаги для каждого варианта, включая создание кластера, резервирование мощностей, установку драйверов и развертывание vLLM, а также рекомендации по очистке ресурсов.