1 миллион токенов, нативный мультимодальный ввод (текст + изображения), вызов инструментов и структурированный вывод. AWS предлагает два варианта развертывания: Amazon SageMaker HyperPod с Inference Operator, который абстрагирует оркестрацию, и самоуправляемый кластер Amazon EKS с использованием EC2 Capacity Blocks. Оба варианта требуют экземпляров p6-b300.48xlarge (8 графических процессоров NVIDIA B300 Blackwell Ultra). Веса доступны в формате MXFP4 на Hugging Face, а vLLM рекомендуется в качестве сервера для обслуживания. Конечная точка предоставляет API, совместимый с OpenAI.