её понять. Molt можно развернуть под лицензией Apache 2.0 с кодами запуска, скриптами Slurm и готовым контейнером, но в статье он позиционируется как исследовательская инфраструктура, а не производственный сервис. Поставляемые рецепты предполагают 2 узла по 8 GPU H100, разделённых на 8 для обучения и 8 для генерации, что делает его доступным для ведущих лабораторий, хорошо финансируемых стартапов, корпоративных исследовательских групп и академических лабораторий с доступом к многоузловым H100/H200. Molt использует Ray для распределения и очередей, vLLM для генерации и NVIDIA AutoModel с FSDP2 для обучения — ничего не форкается, поэтому улучшения вышестоящих проектов приходят как обновление контейнера. Время выполнения использует пул агентов из движков vLLM за маршрутизатором запросов и единственный обучаемый политику актор, с частичной генерацией, приостанавливающей движки и рассылающей шарды актора через NCCL. Запуск RL экспортирует модуль AgentRunner, поддерживающий Env (с шагом, совместимым с Gymnasium) или ChatAgent (пользовательский цикл через OpenAI или Anthropic SDK) через сервер обратной петли, обеспечивающий точное накопление токенов. Инварианты корректности дизайна включают идентичность токенов, семантику версий политики и согласованность прямого прохода; для политик на основе смеси экспертов Molt применяет повтор маршрутизации генерации, где vLLM возвращает идентификаторы экспертов для каждого токена, а прямой проход обучения воспроизводит их. Пропускная способность статистически сравнима со стеком на основе Megatron, с раскрытой оговоркой о несоответствии MoE, и тот же цикл запускает плотную модель 4B или MoE 700B с параметром --fsdp.ep_size 256.