Compressão de Modelos de IA da Multiverse Computing Acelera Inferência em Hardware Padrão
A Multiverse Computing desenvolveu um método para comprimir modelos de IA, permitindo que eles executem mais rapidamente em hardware padrão, sem aceleradores especializados. A técnica, que utiliza decomposição em valores singulares, supostamente alcança uma aceleração de até 10 vezes em CPUs.
Multiverse Computing
Meta AI (GNews)24.07 · 00:03



