ускорителе. FSDP (Fully Sharded Data Parallel, также известный как ZeRO — Zero Redundancy Optimizer) шардирует веса модели, градиенты и состояния оптимизатора, используя операции AllGather и ReduceScatter, и упирается в вычисления при небольших размерах батча. Тензорный параллелизм (tensor parallelism) шардирует матрицы весов, обмениваясь активациями, и лучше всего сочетается с FSDP, чтобы снизить размер активаций относительно размера весов. Конвейерный параллелизм (pipeline parallelism) разбивает модель по слоям, минимизируя объём передаваемых данных, но вызывая «пузыри конвейера» (pipeline bubbles), которые можно смягчить за счёт микробатчинга или перекрытия вычислений. В статье отмечается, что комбинация FSDP и тензорного параллелизма почти всегда ограничена вычислениями, а конвейеризация широко применяется в кластерах на базе GPU. В заключение делается вывод, что цель состоит в масштабировании при одновременном контроле накладных расходов.