하드웨어 및 추론 🇷🇺 24.07.2026 02:01

AMD, 432GB HBM4 및 최대 40 PFLOPS 성능의 Instinct MI455X AI 가속기 발표

AMD가 데이터센터용 Instinct MI455X AI 가속기를 공개했습니다. CDNA 5 아키텍처 기반으로 432GB HBM4 메모리와 MXFP4에서 최대 40 PFLOPS의 피크 성능을 제공합니다. GPU에는 3200억 개의 트랜지스터가 포함되며, TSMC N2 및 N3P 공정을 사용한 멀티 칩렛 설계를 채택했습니다. 메모리 대역폭은 이전 세대 대비 2.9배 향상되었습니다. 또한 AMD는 과학 및 주권 AI 워크로드용 Instinct MI430X도 발표했습니다.
AMD는 데이터센터용 Instinct MI455X AI 가속기를 출시했다. CDNA 5 아키텍처를 기반으로 하며 대규모 AI 학습, 추론 및 랙 스케일 시스템을 대상으로 한다. 각 가속기는 432GB의 HBM4 메모리와 최고 대역폭 23.3TB/s를 탑재한다. GPU는 3200억 개의 트랜지스터로 구성되며 멀티 칩렛 설계를 채택했다: TSMC N2(2nm) 공정으로 제조된 8개의 가속기 컴플렉스 다이(ACD), 2개의 패브릭 칩렛, TSMC N3P(3nm) 공정으로 제조된 2개의 입출력 칩렛. 256개의 워크 그룹 프로세서(WGP) 컴퓨트 유닛, 각각 96MB인 두 블록으로 나뉜 192MB의 L2 캐시, 192채널 인터페이스를 통한 12개의 HBM4 메모리 스택을 특징으로 하며 PCIe Gen 6 및 UALink 네트워킹을 지원한다. 성능은 MXFP8/MXFP6에서 20.13 PFLOPS, MXFP4에서 40.26 PFLOPS에 달한다. Instinct MI355X와 비교하여 MI455X는 1.5배 더 많은 메모리, 2.9배 높은 메모리 대역폭, 4배 높은 MXFP8/MXFP4 성능을 제공한다. 새로운 CDNA 5 기능에는 비동기 데이터 전송을 위한 텐서 데이터 무버(Tensor Data Mover), 작업 그룹 클러스터링, 멀티캐스트, 데이터 프리페칭, 분할 배리어, 지연 시간 단축을 위한 명령 프로세서가 포함된다. 가속기는 하나, 둘 또는 여덟 개의 파티션(NPS1 및 NPS2 모드)으로 공간 분할을 지원한다. AMD는 과학 컴퓨팅, 주권 AI 및 AI-HPC 워크로드를 위한 Instinct MI430X도 발표했으며, 288 TFLOPS FP64 성능을 주장했지만 메모리 구성은 공개하지 않았다.
출처: 3DNews — 원문
관련 게시물 ↓
새로운 뉴스