Uusi DeepSeek-V3-tekninen raportti: kuinka laitteiston ja ohjelmiston yhteissuunnittelu mahdollistaa suurten mallien edullisen koulutuksen
DeepSeek
NVIDIA
Alibaba/Qwen
Meta
DeepSeek-V3-tiimin uusi 14-sivuinen tekninen raportti, jonka toisena kirjoittajana on DeepSeekin toimitusjohtaja Wenfeng Liang, on julkaistu. Asiakirja analysoi suurten kielimallien skaalaushaasteita ja laitteistoinfrastruktuurin roolia, ehdottaen ratkaisuja, jotka perustuvat mallien ja laitteiston yhteissuunnitteluun kustannustehokkaan koulutuksen ja päättelyn mahdollistamiseksi.
Команда DeepSeek-V3 выпустила новый технический доклад, в котором соавтором указан гендиректор компании Вэньфэн Лян. 14-страничный документ посвящён проблемам масштабирования больших языковых моделей (LLM) и отражению аппаратных ограничений. В отличие от предыдущей публикации, описывавшей архитектуру V3, новый отчёт фокусируется на взаимосвязи между разработкой моделей и их аппаратным обеспечением. DeepSeek-V3 обучалась на кластере из 2048 NVIDIA H800 GPU и служит примером того, как учёт характеристик «железа» позволяет преодолеть узкие места — нехватку памяти, вычислительной эффективности и пропускной способности интерконнекта. Среди ключевых архитектурных решений — механизм Multi-head Latent Attention (MLA), сжимающий кэш ключей-значений до 70 КБ на токен (против 516 КБ у LLaMA-3.1 405B и 327 КБ у Qwen-2.5 72B). Экономия вычислений достигается за счёт разреженной архитектуры DeepSeekMoE: модель с 671 млрд параметров активирует лишь 37 млрд на токен, что требует около 250 GFLOPS на токен против 394 у Qwen-2.5 72B и 2448 у LLaMA-3.1 405B. Для ускорения инференса используется двойная микробатчевая архитектура, перекрывающая коммуникацию вычислениями, а также разделение на этапы prefill и decode. DeepSeek-V3 стала первой публично известной большой моделью, обученной с использованием FP8 смешанной точности, что снизило вычислительные затраты. Для межузлового обмена данные сжимаются с помощью FP8 (LogFMT), что вдвое сокращает объём коммуникации. Из-за регуляторных ограничений NVIDIA H800 имеет вдвое меньшую пропускную способность NVLink (400 ГБ/с против 900), поэтому DeepSeek применил «узел-ориентированную маршрутизацию» экспертов MoE, группируя экспертов в 8 групп по 32 на одном узле и ограничивая число узлов-получателей для каждого токена четырьмя. В документе также обсуждаются перспективные направления: объединение scale-up и scale-out в единую шину (UB), внедрение специализированных сопроцессоров для сетевого трафика, динамическое управление пропускной способностью NVLink/PCIe и использование топологии Multi-Plane Fat-Tree.
Lähde: Synced —
Alkuperäinen
