IBM

Dernières actualités, modèles et sorties d'IA de IBM. ['ChartNet', 'Granite 4.0', 'Granite-Docling-258M', 'Granite Speech', 'Granite Speech 4.0 1B', 'Granite Speech 4.1 2B', 'Granite Speech 4.1 2B-NAR', 'Granite-Vision-3.3-2B', 'IBM gender classifier', 'сверхпроводящий квантовый компьютер IBM']

Recherche 🇺🇸

Au-delà des LLM standard : hybrides d’attention linéaire, modèles de diffusion de texte, modèles de monde de code et petits transformeurs récurrents

L’article explore des alternatives aux LLM standards basés sur l’attention autorégressive des transformeurs : les hybrides d’attention linéaire (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), les modèles de diffusion de texte, les modèles de monde de code et les petits transformeurs récurrents. L’auteur note un retour à l’attention classique dans MiniMax-M2 et la complexité de l’attention linéaire en production.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
Infos fraîches