Les startups à la poursuite de la prochaine grande innovation dans les LLM
Liquid AI
Une vague de startups tente de surmonter les limitations des transformers, la technologie qui sous-tend les LLM actuels. Elles proposent de nouvelles architectures et techniques pour rendre les modèles plus rapides, plus efficaces et potentiellement plus intelligents, dans le but de détrôner les géants de l'IA.
Les Transformers, introduits dans un article de Google en 2017, alimentent tous les grands modèles de langage, mais leur mécanisme d'attention dense est coûteux en calcul et peine avec les contextes longs. Des startups s'attaquent à ces défauts : Subquadratic affirme que son modèle à attention sparse, SubQ, rivalise avec les LLM grand public ; Manifest AI remplace l'attention par une « rétention de puissance » et a publié PowerCoder et Brumby ; Liquid AI associe les Transformers aux réseaux neuronaux liquides pour créer des LFM (modèles de fondation liquides) hybrides, plus petits et plus économes en énergie ; Inception utilise la diffusion pour générer des blocs de texte entiers d'un coup, avec son modèle Mercury 2, qui serait 10 fois plus rapide que GPT-4 ; et le modèle « Dragon Hatchling » de Pathway excelle dans les puzzles de sudoku, suggérant une évolution au-delà du langage. Ces startups voient une opportunité de changer la façon dont les LLM sont construits, avec des gains potentiels significatifs en vitesse, en efficacité et en capacité.
Source: MIT Technology Review —
original
