RisetModel 🇷🇺 11.08.2026 00:02

Meningkatkan Skala Pelatihan LLM: Dari Satu Chip hingga Pusat Data. Bab 4: Melatih Transformer

Bab ini mengulas empat jenis paralelisme untuk melatih transformer pada banyak akselerator: paralelisme data, paralelisme data yang sepenuhnya di-sharding (FSDP), paralelisme tensor, dan paralelisme pipeline. Ini membahas kelebihan, kekurangan, dan kapan menggabungkannya, dengan menekankan pentingnya mencapai kinerja yang terikat komputasi untuk skalabilitas.
Artikel ini menjelaskan cara melatih transformer secara efisien dan dalam skala besar. Artikel ini memperkenalkan notasi untuk dimensi model (D, F, B, T, L) dan perangkat keras (C, W, X, Y, Z). Empat jenis paralelisme dijelaskan: paralelisme data membagi batch di seluruh akselerator, memerlukan AllReduce untuk agregasi gradien, dan efektif ketika model muat dalam satu akselerator. FSDP (ZeRO) membagi bobot model, gradien, dan status pengoptimal, menggunakan AllGather dan ReduceScatter, dan terikat komputasi dengan ukuran batch kecil. Paralelisme tensor membagi matriks bobot, menukar aktivasi, dan paling baik dikombinasikan dengan FSDP untuk mengurangi ukuran aktivasi relatif terhadap bobot. Paralelisme pipa membagi model di seluruh lapisan, meminimalkan transfer data tetapi memperkenalkan 'gelembung pipa,' yang dapat dikurangi dengan microbatching atau tumpang tindih komputasi. Artikel ini mencatat bahwa kombinasi FSDP+TP hampir selalu terikat komputasi, dan pipelining umum untuk klaster GPU. Artikel ini menyimpulkan bahwa tujuannya adalah untuk menskalakan sambil mengelola overhead.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru