Nuevo informe técnico de DeepSeek-V3: cómo el codiseño hardware-software permite el entrenamiento de bajo costo de modelos grandes
DeepSeek
NVIDIA
Alibaba/Qwen
Meta
Un nuevo artículo técnico del equipo de DeepSeek, con el director ejecutivo Wenfeng Liang como coautor, explora el codiseño de modelos consciente del hardware para reducir los costos de entrenamiento de LLM. Utilizando DeepSeek-V3 entrenado en 2048 GPU NVIDIA H800 como caso de estudio, el artículo detalla innovaciones en eficiencia de memoria (MLA), computación dispersa (DeepSeekMoE), entrenamiento FP8 y enrutamiento consciente de la interconexión.
El artículo de 14 páginas, 'Desafíos de Escalado y Reflexiones sobre Hardware para Arquitecturas de IA', analiza cómo las restricciones de hardware (memoria, cómputo, ancho de banda de interconexión) moldean el diseño de los Modelos de Lenguaje Grande (LLM, por sus siglas en inglés: Large Language Models). DeepSeek-V3 utiliza Atención Latente Multi-Cabeza (MLA, por sus siglas en inglés: Multi-head Latent Attention) para comprimir el caché de clave-valor (KV) a 70 KB por token, en comparación con 516 KB de LLaMA-3.1 405B. Su arquitectura DeepSeekMoE activa solo 37B de los 671B parámetros por token, reduciendo los FLOPs por token a aproximadamente 250 GFLOPS, frente a 394 de Qwen2.5-72B y 2448 de LLaMA-3.1 405B. El modelo emplea entrenamiento de precisión mixta FP8 y comunicación de baja precisión LogFMT, reduciendo el volumen de comunicación en un 50% respecto a BF16. Para mitigar el ancho de banda reducido de NVLink en la NVIDIA H800 (400 GB/s frente a 900 GB/s en la H100), el enrutamiento consciente de nodos agrupa 256 expertos en 8 grupos locales por nodo, limitando cada token a un máximo de 4 nodos. El artículo aboga por una interconexión unificada de escalado vertical y horizontal, y por coprocesadores de comunicación dedicados.
Fuente: Synced —
original
