AMD et Cerebras s'associent pour développer une plateforme d'inférence IA à ultra-faible latence

Cerebras SystemsCerebras Systems NVIDIANVIDIA
AMD et Cerebras Systems créent une plateforme de calcul qui combine les accélérateurs AMD Instinct et les puces WSE de Cerebras basées sur la mémoire SRAM pour l'inférence à faible latence des agents d'IA. La solution, disponible dans Cerebras Cloud cette année, génère cinq fois plus de tokens par watt et nécessite moins de puces que les systèmes similaires des concurrents.
AMD и Cerebras Systems объявили о совместной разработке вычислительной платформы, которая сочетает ускорители AMD Instinct и чипы Cerebras Wafer Scale Engine (WSE) со встроенной памятью SRAM. Платформа предназначена для инференса ИИ-агентов — этапа, требующего большого объёма быстрой памяти. По словам главы Cerebras Эндрю Фельдмана, проект закрывает пробел в портфеле AMD, возникший после покупки Nvidia стартапа Groq за $20 млрд. Чипы Cerebras WSE используют SRAM вместо HBM4, что обеспечивает скорость генерации более 2000 токенов в секунду. В гибридной системе сложные запросы обрабатываются на ускорителях AMD Instinct, а генерация токенов делегируется Cerebras WSE, что повышает энергоэффективность в пять раз (токенов на ватт). Для сравнения: для обслуживания модели Kimi K2.5 (1 трлн параметров) требуется две тысячи чипов Groq, а в системе AMD и Cerebras — всего несколько десятков. Объединённое решение станет доступно в Cerebras Cloud до конца года.
Source: 3DNews — original
Nos articles précédents sur ce sujet ↓
Infos fraîches