AMD y Cerebras se unen para desarrollar una plataforma de inferencia de IA de latencia ultrabaja

Cerebras SystemsCerebras Systems NVIDIANVIDIA
AMD y Cerebras Systems están creando una plataforma informática que combina los aceleradores AMD Instinct y los chips WSE de Cerebras basados en memoria SRAM para la inferencia de baja latencia de agentes de IA. La solución, disponible en Cerebras Cloud este año, genera cinco veces más tokens por vatio y requiere menos chips que sistemas similares de la competencia.
AMD и Cerebras Systems объявили о совместной разработке вычислительной платформы, которая сочетает ускорители AMD Instinct и чипы Cerebras Wafer Scale Engine (WSE) со встроенной памятью SRAM. Платформа предназначена для инференса ИИ-агентов — этапа, требующего большого объёма быстрой памяти. По словам главы Cerebras Эндрю Фельдмана, проект закрывает пробел в портфеле AMD, возникший после покупки Nvidia стартапа Groq за $20 млрд. Чипы Cerebras WSE используют SRAM вместо HBM4, что обеспечивает скорость генерации более 2000 токенов в секунду. В гибридной системе сложные запросы обрабатываются на ускорителях AMD Instinct, а генерация токенов делегируется Cerebras WSE, что повышает энергоэффективность в пять раз (токенов на ватт). Для сравнения: для обслуживания модели Kimi K2.5 (1 трлн параметров) требуется две тысячи чипов Groq, а в системе AMD и Cerebras — всего несколько десятков. Объединённое решение станет доступно в Cerebras Cloud до конца года.
Fuente: 3DNews — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas