AMD presenta el acelerador de IA Instinct MI455X con 432 GB HBM4 y rendimiento de hasta 40 PFLOPS
AMD ha presentado sus aceleradores de IA Instinct MI455X para centros de datos, basados en la arquitectura CDNA 5, con 432 GB de memoria HBM4 y un rendimiento máximo de hasta 40 PFLOPS en MXFP4. La GPU incluye 320 mil millones de transistores, utiliza un diseño multi-chiplet con procesos TSMC N2 y N3P, y ofrece una mejora de 2,9 veces en el ancho de banda de memoria respecto a la generación anterior. Además, AMD anunció el Instinct MI430X para cargas de trabajo científicas y de IA soberana.
AMD presentó los aceleradores de IA Instinct MI455X para centros de datos, basados en la arquitectura CDNA 5, diseñados para entrenamiento e inferencia de IA a gran escala y sistemas a escala de rack. Cada acelerador cuenta con 432 GB de memoria HBM4 con un ancho de banda máximo de 23,3 TB/s. La GPU contiene 320 mil millones de transistores y utiliza un diseño multichiplet: ocho chiplets de núcleo de acelerador (ACD, por sus siglas en inglés) fabricados con el proceso TSMC N2 (2 nm), dos chiplets de interconexión y dos chiplets de E/S con el proceso TSMC N3P (3 nm). Incluye 256 unidades de cómputo de grupo de trabajo (WGP, por sus siglas en inglés), 192 MB de caché L2 divididos en dos bloques de 96 MB, 12 pilas de memoria HBM4 a través de una interfaz de 192 canales, y admite PCIe Gen 6 y redes UALink. El rendimiento alcanza los 20,13 PFLOPS en MXFP8/MXFP6 y 40,26 PFLOPS en MXFP4. En comparación con el Instinct MI355X, el MI455X ofrece 1,5 veces más memoria, 2,9 veces más ancho de banda de memoria y 4 veces más rendimiento en MXFP8/MXFP4. Las nuevas características de CDNA 5 incluyen Tensor Data Mover para transferencia asíncrona de datos, agrupación de grupos de trabajo, multidifusión, precarga de datos, barreras divididas y un procesador de comandos para menor latencia. Los aceleradores admiten particionamiento espacial en una, dos u ocho particiones (modos NPS1 y NPS2). AMD también anunció el Instinct MI430X para computación científica, IA soberana y cargas de trabajo de IA-HPC, afirmando un rendimiento de 288 TFLOPS en FP64, pero sin detallar la configuración de memoria.
Fuente: 3DNews —
original
