NVIDIA представила srt-slurm: фреймворк для воспроизводимых бенчмарков распределённого LLM-сервинга на SLURM
NVIDIA
NVIDIA выпустила open-source фреймворк srt-slurm, который через утилиту srtctl и YAML-конфигурации автоматизирует создание, валидацию и запуск бенчмарков для распределённого вывода больших языковых моделей в среде SLURM. Инструмент поддерживает разделение prefill/decode, параметрические сценарии, программный Python API и анализ производительности через Парето-фронтир.
Фреймворк srt-slurm от NVIDIA позволяет описывать конфигурации бенчмарков на YAML, конвертировать их в sbatch-скрипты и выполнять на GPU-кластерах под управлением SLURM. Утилита srtctl включает команды dry-run, apply, preflight, monitor и do_sweep. Встроенные рецепты покрывают платформы gb200, h100, b200, а также мокер для тестов без реального кластера. Продемонстрирована настройка disaggregated-развёртывания DeepSeek-R1 c разделением prefill и decode на разные ноды и пулы воркеров на движке SGLang. Параметрические сценарии поддерживают перебор по сетке (grid search) с автогенерацией конфигураций. Программный Python API через модуль srtctl.core позволяет загружать конфиги, генерировать сценарии и расширять шаблоны. Для анализа результатов предлагается библиотека srtlog (парсеры логов) и Streamlit-дашборд с построением Парето-границы по задержке и пропускной способности. Воспроизводимость обеспечивается блоком identity в рецепте, фиксирующим версию модели, контейнера и фреймворков.
- Сокращения
- SLURM = Simple Linux Utility for Resource Management — система управления ресурсами и планирования заданий для Linux
- YAML = YAML Ain't Markup Language — формат сериализации данных
- API = Application Programming Interface — программный интерфейс приложения
- GPU = Graphics Processing Unit — графический процессор
- Python — язык программирования Python
Источник: MarkTechPost —
оригинал
