⚡ TIN NÓNG

NVIDIA Groq 3: SRAM, Disaggregation, and Determinism in the New AI Platform

NVIDIANVIDIA GroqGroq
After acquiring Groq for $20 billion, NVIDIA integrated LPU accelerators into the Vera Rubin platform, creating a heterogeneous architecture for inference. The new Groq 3 LPX rack accelerator, based on Groq 3 LP30 chips with 500 MB of SRAM and 150 TB/s memory bandwidth, ensures deterministic execution and low latency. Phase-based disaggregation of decoding (AFD) allows separating FFN computations from attention, distributing the workload between GPUs and LPUs.
NVIDIA đã hoàn tất thương vụ lớn nhất trong lịch sử, mua lại Groq với giá 20 tỷ USD, và tích hợp các bộ tăng tốc AI LPU có kiến trúc khác biệt vào nền tảng Vera Rubin, nhằm tăng tốc mạnh mẽ khả năng suy luận, biến nó thành phi tập trung hóa và nền tảng trở nên không đồng nhất. Bộ tăng tốc dạng kệ mới NVIDIA Groq 3 LPX có công suất 160 kW chứa 256 chip AI Groq 3 (LP30) với 96 tỷ bóng bán dẫn mỗi chip, được kết hợp thành 32 nút cao 1U với làm mát bằng chất lỏng và thiết kế không cáp MGX. Chip Groq 3 LPU được xây dựng trên bộ nhớ SRAM dung lượng 500 MB với băng thông 150 TB/s, không có bộ nhớ đệm và phân cấp, cho phép di chuyển dữ liệu một cách tường minh dưới sự điều khiển của trình biên dịch. Đặc điểm xác định của LPU là tính tất định - không có độ biến thiên trong thời gian chạy nhờ chuyển tất cả các quyết định lên trình biên dịch và sử dụng giao thức C2C (chip-to-chip) chạy gần đồng bộ. Cải tiến chính là phi tập trung hóa giải mã theo pha (AFD), tách cơ chế attention chạy trên GPU khỏi các phép toán FFN/MoE được xử lý trên LPX. Điều này cho phép GPU hấp thụ lượng ngữ cảnh ngày càng tăng, trong khi tải trên LPU không đổi và không phụ thuộc vào độ dài ngữ cảnh. Để sử dụng thực tế giải mã không đồng nhất, NVIDIA Dynamo đảm bảo điều phối yêu cầu, phân phối công việc và duy trì độ trễ ổn định dưới lưu lượng cao. Kết hợp Vera Rubin NVL72 với Groq 3 LPX cho thông lượng cao hơn 35 lần so với Grace Blackwell NVL72 ở mức 400 yêu cầu mỗi giây (TPS) trên mỗi người dùng, và doanh thu trên mỗi MW cao hơn đến 10 lần cho các tải nhạy cảm với độ trễ.
Nguồn: ServerNews — bản gốc
Bài viết liên quan trước đây ↓
Tin mới