Mergers & AcquisitionsHardware & Inference 🇷🇺 24.07.2026 14:03

AMD and Cerebras Join Forces to Develop Ultra-Low-Latency AI Inference Platform

Cerebras SystemsCerebras Systems NVIDIANVIDIA
AMD and Cerebras Systems are creating a computing platform that combines AMD Instinct accelerators and Cerebras WSE chips based on SRAM memory for low-latency inference of AI agents. The solution, available in Cerebras Cloud this year, generates five times more tokens per watt and requires fewer chips than similar systems from competitors.
AMD и Cerebras Systems объявили о совместной разработке вычислительной платформы, которая сочетает ускорители AMD Instinct и чипы Cerebras Wafer Scale Engine (WSE) со встроенной памятью SRAM. Платформа предназначена для инференса ИИ-агентов — этапа, требующего большого объёма быстрой памяти. По словам главы Cerebras Эндрю Фельдмана, проект закрывает пробел в портфеле AMD, возникший после покупки Nvidia стартапа Groq за $20 млрд. Чипы Cerebras WSE используют SRAM вместо HBM4, что обеспечивает скорость генерации более 2000 токенов в секунду. В гибридной системе сложные запросы обрабатываются на ускорителях AMD Instinct, а генерация токенов делегируется Cerebras WSE, что повышает энергоэффективность в пять раз (токенов на ватт). Для сравнения: для обслуживания модели Kimi K2.5 (1 трлн параметров) требуется две тысячи чипов Groq, а в системе AMD и Cerebras — всего несколько десятков. Объединённое решение станет доступно в Cerebras Cloud до конца года.
Source: 3DNews — original
Our earlier posts on this topic ↓
Fresh news