El rendimiento por vatio es la métrica clave para la eficiencia de la infraestructura de IA
NVIDIA
CoreWeave
Perplexity AI
Fireworks AI
Con el consumo de energía limitado, la métrica de 'rendimiento por vatio' se vuelve crucial para el retorno de la inversión de las fábricas de IA. NVIDIA afirma que su plataforma Blackwell NVL72 con un dominio de 72 GPU ofrece hasta 25 veces de ventaja sobre la generación Hopper, y la futura Vera Rubin continuará mejorando la eficiencia energética a nivel de rack.
La potencia es una limitación inherente a la infraestructura de inteligencia artificial. La cantidad de tokens que una fábrica de IA puede generar dentro de un presupuesto energético fijo determina sus ingresos y rentabilidad. Por lo tanto, el rendimiento por vatio —una métrica que no se puede inflar, sino que solo se puede ganar con resultados reales— está en el centro de las fábricas de IA. Con el aumento de la demanda de tokens por parte de la IA agente, las decisiones de infraestructura que tomen las organizaciones hoy determinarán quién podrá escalar en un mundo con potencia limitada. Prácticamente todos los modelos frontera de IA actuales funcionan con la arquitectura de mezcla de expertos (MoE). Para atender eficientemente estos modelos, es importante el tamaño del dominio de GPU: la cantidad de GPU conectadas mediante un interconector ultrarrápido y escalable, y cuanto más grande, mejor. La generación NVIDIA Hopper estableció el estándar con un dominio de 8 GPU, pero la escala de los modelos frontera actuales lo ha superado. Atender una MoE con un dominio de 72 GPU requiere un codiseño completo de la pila y una profundidad operativa obtenida al operar estos modelos bajo carga de producción real. La plataforma NVIDIA Blackwell NVL72 ya proporciona esa base, demostrando el mayor rendimiento por vatio para maximizar los ingresos y el menor costo por token para maximizar el margen. Sobre esta base se construye la próxima plataforma NVIDIA Vera Rubin, que mejorará aún más la eficiencia energética a nivel de rack. Entre los resultados, NVIDIA GB300 NVL72 ofrece un aumento de hasta 25 veces en rendimiento por vatio en comparación con la generación Hopper para los principales modelos abiertos. Esto se logra mediante un codiseño extremo en todos los niveles: desde el silicio hasta el software. NVIDIA NVLink Switch, creado específicamente para escalar dominios de GPU, ahora en su sexta generación con la plataforma Vera Rubin, admite computación en red SHARP. La pila de software incluye NVIDIA Dynamo, TensorRT LLM, SGLang y vLLM, así como optimizaciones: cuantización NVFP4, servicio desagregado, paralelismo de expertos, enrutamiento consciente de KV y descarga de caché KV. En DeepSeek V4, el rendimiento por vatio mejoró 5 veces en un solo mes. El software NVIDIA DSX MaxLPS permite a los operadores ejecutar hasta un 40% más de GPU dentro del mismo presupuesto energético mediante la redistribución de potencia. Los principales laboratorios de IA, como Anthropic, OpenAI y SpaceXAI, utilizan NVIDIA Blackwell NVL72 para inferencia. CoreWeave ha desplegado Kimi K2.6 en NVIDIA GB300 NVL72. Perplexity ejecuta Qwen3 235B y Qwen3.5-397B-A17B en NVIDIA GB200 NVL72. Fireworks AI despliega GLM 5.2 en la plataforma NVIDIA Blackwell para clientes, incluidos Cursor y Factory AI.
Fuente: NVIDIA blog —
original
