Масштабирование обучения LLM: от одного чипа до дата-центра. Глава 4. Обучение трансформера
В главе рассматриваются четыре типа параллелизма для обучения трансформеров на нескольких ускорителях: параллелизм данных, полностью сегментированный параллелизм данных (FSDP), тензорный параллелизм и конвейерный параллелизм. Обсуждаются их преимущества, недостатки и случаи, когда их следует комбинировать, с акцентом на важность достижения вычислительно-ограниченной производительности для масштабируемости.



