⚡ 속보
NVIDIA Groq 3: 새로운 AI 플랫폼의 SRAM, 분리 및 결정론
NVIDIA
Groq
NVIDIA의 200억 달러 규모의 Groq 인수로 LPU 가속기가 Vera Rubin 플랫폼에 통합되어 분리형 이기종 AI 추론이 가능해졌습니다. 새로운 Groq 3 LPX 랙 시스템은 256개의 LPU를 결합해 빠르고 결정론적인 토큰 생성을 제공하며, Vera Rubin NVL72는 유연한 학습 및 추론을 처리합니다. 이 플랫폼은 저지연 대화형 AI 및 멀티 에이전트 워크로드를 대상으로 하며, 사용자당 400 TPS에서 Grace Blackwell NVL72보다 최대 35배 빠른 성능을 약속합니다.
NVIDIA는 200억 달러 규모의 인수를 통해 Groq의 LPU(언어 처리 장치) 아키텍처를 Vera Rubin AI 플랫폼에 통합했습니다. 그 결과 Vera Rubin NVL72는 일반적인 훈련과 추론을 담당하고, Groq 3 LPX 랙 가속기는 저지연 토큰 생성을 위한 특화 엔진을 제공하는 이기종 시스템이 탄생했습니다. LPX는 각각 960억 개의 트랜지스터를 탑재한 256개의 Groq 3(LP30) 칩을 포함하며, RealScale C2C 인터커넥트로 연결됩니다. LPU는 칩당 500MB의 SRAM(150TB/s 대역폭), 캐시 미사용, 컴파일러가 제어하는 명시적 데이터 이동을 특징으로 하는 결정론적 실행 모델을 기반으로 설계되었습니다. 이는 지터를 제거하고 예측 가능한 지연 시간을 보장하여 대화형 AI 및 다중 에이전트 시스템에 중요합니다. 이 플랫폼은 어텐션과 FFN(피드포워드 네트워크) 연산을 분리하는 위상 분리(AFD)를 사용합니다. GPU는 프리필(prefill) 및 장문맥(long-context) 어텐션을 처리하고, LPU는 FFN/MoE(혼합 전문가) 디코딩을 가속화합니다. NVIDIA는 사용자당 초당 400토큰(TPS) 처리 시 Grace Blackwell NVL72 대비 최대 35배의 속도 향상, 지연 시간에 민감한 워크로드에서 MW당 최대 10배의 수익 향상을 주장합니다. NVIDIA Dynamo 소프트웨어는 이기종 디코딩을 오케스트레이션하여 요청을 분류하고 중간 활성화(intermediate activation)를 관리합니다.
출처: ServerNews —
원문
