Hardware e Inferencia RSS

Nunchaku Lite permite inferencia de difusión de 4 bits en Diffusers

Nunchaku Lite, una nueva integración en Hugging Face Diffusers, permite cargar modelos de difusión cuantizados a 4 bits con una simple llamada from_pretrained(), sin necesidad de pipelines personalizados ni compilación local de CUDA. Reduce el uso de VRAM hasta un 50% y acelera la inferencia aproximadamente 1.35 veces, con mejoras adicionales mediante torch.compile.

Hugging FaceHugging Face BaiduBaidu
Hugging Face blog24.07 · 02:04

AMD presenta el acelerador de IA Instinct MI455X con 432 GB HBM4 y rendimiento de hasta 40 PFLOPS

AMD ha presentado sus aceleradores de IA Instinct MI455X para centros de datos, basados en la arquitectura CDNA 5, con 432 GB de memoria HBM4 y un rendimiento máximo de hasta 40 PFLOPS en MXFP4. La GPU incluye 320 mil millones de transistores, utiliza un diseño multi-chiplet con procesos TSMC N2 y N3P, y ofrece una mejora de 2,9 veces en el ancho de banda de memoria respecto a la generación anterior. Además, AMD anunció el Instinct MI430X para cargas de trabajo científicas y de IA soberana.

3DNews24.07 · 02:01
Noticias frescas