Глубокое погружение в DeepSeek-V3: как аппаратно-ориентированный совместный дизайн снижает стоимость обучения больших языковых моделей

DeepSeekDeepSeek NVIDIANVIDIA
Новый технический отчет команды DeepSeek-V3 с соавторством CEO Вэньфэна Ляна раскрывает секреты недорогого обучения больших языковых моделей. Документ объемом 14 страниц описывает, как совместный учет архитектуры модели и аппаратных ограничений, включая FP8-обучение и оптимизацию памяти KV-кэша, позволил обучить DeepSeek-V3 с 671 миллиардом параметров на кластере из 2048 NVIDIA H800 GPU с минимальными затратами.
Команда DeepSeek опубликовала новый технический отчет, посвященный проблемам масштабирования и отражению аппаратных ограничений в архитектурах ИИ. В работе, соавтором которой выступил CEO компании Вэньфэн Лян, подробно анализируется взаимосвязь между разработкой больших языковых моделей (LLM), их обучением и аппаратной инфраструктурой. DeepSeek-V3, обученный на кластере из 2048 NVIDIA H800 GPU, служит примером того, как синергия между дизайном модели и аппаратными особенностями позволяет преодолеть узкие места, связанные с пропускной способностью памяти, вычислительной эффективностью и межсоединениями. В отчете рассматриваются ключевые инновации DeepSeek-V3: архитектура DeepSeekMoE для разреженных вычислений, уменьшающая вычислительные затраты на порядок по сравнению с плотными моделями; многоголовое скрытое внимание (MLA), которое сжимает KV-кэш до 70 КБ на токен против 516 КБ у LLaMA-3.1 405B; и FP8-смешанное обучение, впервые примененное для крупномасштабной MoE-модели. Для повышения скорости инференса используется конвейерное перекрытие вычислений и коммуникации, а для снижения задержек при экспертной параллельности — низкоточная коммуникация LogFMT. Отдельное внимание уделено аппаратно-ориентированной маршрутизации с учетом узлов (node-aware routing), которая использует более высокую пропускную способность NVLink по сравнению с InfiniBand. В работе также предложены направления развития будущего аппаратного обеспечения: конвергенция масштабирования внутри узла (scale-up) и между узлами (scale-out), динамическое распределение пропускной способности и использование специализированных копроцессоров для управления сетевым трафиком.
Сокращения
LLM = Large Language Model — большая языковая модель
MoE = Mixture of Experts — смесь экспертов
MLA = Multi-head Latent Attention — многоголовое скрытое внимание
KV = Key-Value — ключ-значение
HBM = High Bandwidth Memory — высокопропускная память
GPU = Graphics Processing Unit — графический процессор
FP8 = Floating Point 8-bit — 8-битное число с плавающей запятой
GQA = Grouped Query Attention — групповое внимание запросов
MQA = Multi-Query Attention — много-запросное внимание
GFLOPS = Giga Floating Point Operations Per Second — миллиард операций с плавающей запятой в секунду
TPS = Tokens Per Second — токенов в секунду
EP = Expert Parallelism — экспертный параллелизм
BF16 = Brain Floating Point 16-bit — 16-битный формат с плавающей запятой Brain
NIC = Network Interface Card — сетевой интерфейсный контроллер
TP = Tensor Parallelism — тензорный параллелизм
PP = Pipeline Parallelism — конвейерный параллелизм
SM = Streaming Multiprocessor — потоковый мультипроцессор
UEC = Ultra Ethernet Consortium — консорциум Ultra Ethernet
UALink = Ultra Accelerator Link — соединение Ultra Accelerator
MPFT = Multi-Plane Fat-Tree — многоплоскостная Fat-Tree
Источник: Synced — оригинал

Наши прошлые публикации по теме

Есть свежие новости