Compressão de Modelos de IA da Multiverse Computing Acelera Inferência em Hardware Padrão
Multiverse Computing
A Multiverse Computing desenvolveu um método para comprimir modelos de IA, permitindo que eles executem mais rapidamente em hardware padrão, sem aceleradores especializados. A técnica, que utiliza decomposição em valores singulares, supostamente alcança uma aceleração de até 10 vezes em CPUs.
A Multiverse Computing, empresa de computação inspirada em quântica, anunciou uma nova abordagem para comprimir modelos de IA usando técnicas de fatoração de matrizes, como a decomposição em valores singulares. O método reduz o tamanho do modelo e os requisitos computacionais, permitindo que modelos grandes sejam executados de forma eficiente em CPUs e GPUs convencionais. Em testes, a técnica alcançou aceleração de inferência de até 10 vezes em CPUs, sem perda significativa de precisão. A empresa afirma que isso pode democratizar a IA, reduzindo a dependência de hardware especializado e caro.
Fonte: Meta AI (GNews) —
original
