AMD and Cerebras Join Forces to Develop Ultra-Low-Latency AI Inference Platform

Cerebras SystemsCerebras Systems NVIDIANVIDIA
AMD and Cerebras Systems are creating a computing platform that combines AMD Instinct accelerators and Cerebras WSE chips based on SRAM memory for low-latency inference of AI agents. The solution, available in Cerebras Cloud this year, generates five times more tokens per watt and requires fewer chips than similar systems from competitors.
AMD và Cerebras Systems thông báo hợp tác phát triển một nền tảng tính toán kết hợp các bộ tăng tốc AMD Instinct và chip Wafer Scale Engine (WSE) của Cerebras với bộ nhớ SRAM tích hợp. Nền tảng này được thiết kế cho suy luận tác nhân AI (AI agent inference) – giai đoạn yêu cầu dung lượng bộ nhớ nhanh lớn. Theo Giám đốc điều hành Cerebras, Andrew Feldman, dự án này lấp đầy khoảng trống trong danh mục sản phẩm của AMD sau khi Nvidia mua lại startup Groq với giá 20 tỷ đô la Mỹ. Chip Cerebras WSE sử dụng SRAM thay vì HBM4 (High Bandwidth Memory 4), mang lại tốc độ sinh hơn 2000 token mỗi giây. Trong hệ thống kết hợp, các truy vấn phức tạp được xử lý trên bộ tăng tốc AMD Instinct, còn quá trình sinh token được giao cho Cerebras WSE, giúp tăng hiệu suất năng lượng lên gấp năm lần (token trên watt). Để so sánh: mô hình Kimi K2.5 (1 nghìn tỷ tham số) cần hai nghìn chip Groq để phục vụ, trong khi hệ thống của AMD và Cerebras chỉ cần vài chục chip. Giải pháp kết hợp sẽ có sẵn trên Cerebras Cloud trước cuối năm nay.
Nguồn: 3DNews — bản gốc
Bài viết liên quan trước đây ↓
Tin mới