⚡ TIN NÓNG

NVIDIA Groq 3: SRAM, Phân tách và Tính tất yếu trong Nền tảng AI Mới

NVIDIANVIDIA GroqGroq
Thương vụ NVIDIA mua lại Groq trị giá 20 tỷ đô la Mỹ đã dẫn đến việc tích hợp các bộ tăng tốc LPU vào nền tảng Vera Rubin, cho phép suy luận AI không đồng nhất và phân tách. Hệ thống rack Groq 3 LPX mới kết hợp 256 LPU để tạo token nhanh, tất yếu, trong khi Vera Rubin NVL72 xử lý đào tạo và suy luận linh hoạt. Nền tảng này hướng đến AI tương tác độ trễ thấp và khối lượng công việc đa tác tử, hứa hẹn hiệu suất nhanh hơn tới 35 lần so với Grace Blackwell NVL72 ở tốc độ 400 token mỗi giây cho mỗi người dùng.
NVIDIA đã tích hợp kiến trúc LPU (Language Processing Unit) của Groq vào nền tảng AI Vera Rubin sau thương vụ mua lại trị giá 20 tỷ đô la. Kết quả là một hệ thống không đồng nhất, trong đó Vera Rubin NVL72 xử lý các tác vụ huấn luyện và suy luận chung, trong khi bộ tăng tốc rack Groq 3 LPX cung cấp một engine chuyên biệt cho việc sinh token với độ trễ thấp. LPX chứa 256 chip Groq 3 (LP30), mỗi chip có 96 tỷ bóng bán dẫn, kết nối qua RealScale C2C. LPU được thiết kế dựa trên mô hình thực thi tất định với 500 MB SRAM mỗi chip (băng thông 150 TB/s), không có bộ nhớ đệm (cache), và việc di chuyển dữ liệu được điều khiển rõ ràng bởi trình biên dịch. Điều này loại bỏ jitter và đảm bảo độ trễ có thể dự đoán trước, rất quan trọng đối với các hệ thống AI tương tác và đa tác tử. Nền tảng sử dụng kỹ thuật phân tách pha (AFD) để tách riêng các thao tác attention và FFN: GPU xử lý prefill và attention với ngữ cảnh dài, trong khi LPU tăng tốc giải mã FFN/MoE. NVIDIA tuyên bố tốc độ nhanh hơn tới 35 lần so với Grace Blackwell NVL72 ở mức 400 token mỗi giây trên mỗi người dùng, và doanh thu trên mỗi MW cao hơn tới 10 lần cho các tác vụ nhạy cảm với độ trễ. Phần mềm NVIDIA Dynamo điều phối quá trình giải mã không đồng nhất, phân loại yêu cầu và quản lý các kích hoạt trung gian.
Nguồn: ServerNews — bản gốc
Bài viết liên quan trước đây ↓
Tin mới