Performance per watt is the key metric for AI infrastructure efficiency
NVIDIA
CoreWeave
Perplexity AI
Fireworks AI
With limited energy consumption, the 'performance per watt' metric becomes crucial for the return on investment of AI factories. NVIDIA claims its Blackwell NVL72 platform with a 72-GPU domain provides up to 25x advantage over the Hopper generation, and the future Vera Rubin will continue to improve rack-level energy efficiency.
전력은 인공지능(AI) 인프라의 본질적인 제약 조건입니다. AI 팩토리가 고정된 전력 예산 내에서 생성할 수 있는 토큰 수는 수익과 수익성을 결정합니다. 따라서 전력 대비 성능(Watt당 성능)은 조작할 수 없고 오직 실질적인 결과로만 얻을 수 있는 지표로서 AI 팩토리의 핵심입니다. 에이전트 AI로 인한 토큰 수요가 증가함에 따라, 조직이 오늘날 내리는 인프라 결정은 전력이 제한된 세계에서 누가 확장할 수 있을지를 결정할 것입니다. 현재 최첨단 AI 모델은 거의 모두 혼합 전문가(MoE, Mixture of Experts) 아키텍처에서 작동합니다. 이러한 모델을 효율적으로 서비스하려면 GPU 도메인의 크기, 즉 초고속 확장 가능한 인터커넥트로 연결된 GPU 수가 중요하며, 클수록 좋습니다. NVIDIA Hopper 세대는 8-GPU 도메인으로 표준을 세웠지만, 현대 최첨단 모델의 규모는 이를 넘어섰습니다. 72-GPU 도메인으로 MoE를 서비스하려면 완전한 스택 공동 설계와 실제 프로덕션 부하에서 이러한 모델을 운영하면서 얻은 운영 깊이가 필요합니다. NVIDIA Blackwell NVL72 플랫폼은 이미 이러한 기반을 제공하며, 수익 극대화를 위한 최고의 전력 대비 성능과 마진 극대화를 위한 최저 토큰 비용을 보여줍니다. 이 기반 위에 차기 NVIDIA Vera Rubin 플랫폼이 구축되어 랙 수준의 에너지 효율성을 더욱 높일 것입니다. 그 결과, NVIDIA GB300 NVL72는 주요 오픈 모델에서 Hopper 세대 대비 최대 25배의 전력 대비 성능 향상을 제공합니다. 이는 실리콘에서 소프트웨어에 이르는 모든 수준에서의 극단적인 공동 설계를 통해 달성됩니다. GPU 도메인 확장을 위해 특별히 제작된 NVIDIA NVLink 스위치는 이제 Vera Rubin 플랫폼에서 6세대로, SHARP 네트워크 컴퓨팅을 지원합니다. 소프트웨어 스택에는 NVIDIA Dynamo, TensorRT LLM, SGLang 및 vLLM이 포함되며, NVFP4 양자화, 분리형 서빙(disaggregated serving), 전문가 병렬 처리, KV 인식 라우팅 및 KV 캐시 오프로딩과 같은 최적화가 포함됩니다. DeepSeek V4에서는 전력 대비 성능이 한 달 만에 5배 개선되었습니다. NVIDIA DSX MaxLPS 소프트웨어를 통해 운영자는 전력 재분배를 통해 동일한 전력 예산 내에서 최대 40% 더 많은 GPU를 실행할 수 있습니다. Anthropic, OpenAI 및 SpaceXAI와 같은 주요 AI 연구소는 NVIDIA Blackwell NVL72를 추론에 사용하고 있습니다. CoreWeave는 NVIDIA GB300 NVL72에 Kimi K2.6을 배포했습니다. Perplexity는 NVIDIA GB200 NVL72에서 Qwen3 235B 및 Qwen3.5-397B-A17B를 실행합니다. Fireworks AI는 Cursor 및 Factory AI를 포함한 고객을 위해 NVIDIA Blackwell 플랫폼에 GLM 5.2를 배포하고 있습니다.
출처: NVIDIA blog —
원문
