La compression de modèles d'IA de Multiverse Computing accélère l'inférence sur du matériel standard
Multiverse Computing
Multiverse Computing a développé une méthode pour compresser les modèles d'IA, leur permettant de fonctionner plus rapidement sur du matériel standard sans accélérateurs spécialisés. La technique, qui utilise la décomposition en valeurs singulières, permettrait d'obtenir une accélération jusqu'à 10 fois sur les processeurs CPU.
Multiverse Computing, une entreprise spécialisée dans le calcul inspiré du quantique, a annoncé une nouvelle approche pour compresser les modèles d'IA utilisant des techniques de factorisation matricielle comme la décomposition en valeurs singulières. La méthode réduit la taille des modèles et les besoins en calcul, permettant aux grands modèles de fonctionner efficacement sur des processeurs et des unités de traitement graphique (GPU) conventionnels. Lors des tests, la technique a permis d'atteindre jusqu'à 10 fois l'accélération de l'inférence sur les processeurs sans perte significative de précision. L'entreprise affirme que cela pourrait démocratiser l'IA en réduisant la dépendance au matériel spécialisé et coûteux.
Source: Meta AI (GNews) —
original
