Hardware & Inferenz 🇷🇺 24.07.2026 02:01

AMD stellt KI-Beschleuniger Instinct MI455X mit 432 GB HBM4 und bis zu 40 PFLOPS Leistung vor

AMD hat seine Instinct MI455X KI-Beschleuniger für Rechenzentren vorgestellt, die auf der CDNA-5-Architektur basieren, mit 432 GB HBM4-Speicher und einer Spitzenleistung von bis zu 40 PFLOPS in MXFP4 ausgestattet sind. Die GPU umfasst 320 Milliarden Transistoren, verwendet ein Multi-Chiplet-Design mit TSMC-N2- und N3P-Prozessen und bietet eine 2,9-fache Verbesserung der Speicherbandbreite gegenüber der vorherigen Generation. Darüber hinaus kündigte AMD den Instinct MI430X für wissenschaftliche und souveräne KI-Workloads an.
AMD hat die KI-Beschleuniger Instinct MI455X für Rechenzentren vorgestellt, die auf der CDNA-5-Architektur basieren und für groß angelegtes KI-Training, Inferenz und Rack-Scale-Systeme ausgelegt sind. Jeder Beschleuniger verfügt über 432 GB HBM4-Speicher mit einer Spitzenbandbreite von 23,3 TB/s. Die GPU enthält 320 Milliarden Transistoren und verwendet ein Multi-Chiplet-Design: acht Accelerator Complex Dies (ACD) im TSMC-N2-Verfahren (2 nm) hergestellt, zwei Fabric-Chips und zwei I/O-Chips im TSMC-N3P-Verfahren (3 nm). Sie verfügt über 256 Work Group Processor (WGP) Compute Units, 192 MB L2-Cache, aufgeteilt in zwei 96-MB-Blöcke, 12 HBM4-Speicherstapel über eine 192-Kanal-Schnittstelle und unterstützt PCIe Gen 6 und UALink-Netzwerk. Die Leistung erreicht 20,13 PFLOPS bei MXFP8/MXFP6 und 40,26 PFLOPS bei MXFP4. Im Vergleich zum Instinct MI355X bietet der MI455X 1,5-mal mehr Speicher, 2,9-mal höhere Speicherbandbreite und 4-mal höhere MXFP8/MXFP4-Leistung. Zu den neuen CDNA-5-Funktionen gehören Tensor Data Mover für asynchrone Datenübertragung, Work-Group-Clustering, Multicast, Datenvorauslesen, Split Barriers und ein Command Processor für geringere Latenz. Die Beschleuniger unterstützen die räumliche Partitionierung in eine, zwei oder acht Partitionen (NPS1- und NPS2-Modi). AMD kündigte auch den Instinct MI430X für wissenschaftliches Rechnen, souveräne KI und KI-HPC-Workloads an und gibt eine FP64-Leistung von 288 TFLOPS an, ohne die Speicherkonfiguration im Detail zu nennen.
Quelle: 3DNews — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten