Allen Institute for AI

Dernières actualités, modèles et sorties d'IA de Allen Institute for AI. ['MolmoAct2', 'OLMo 2', 'OLMo 2 7B', 'OLMo 3', 'OLMo 3 7B', 'Tülu 3']

Modèles 🇺🇸

Comparaison des architectures de grands modèles de langage : de DeepSeek V3 à OLMo 2

Sebastian Raschka a publié une comparaison détaillée des architectures des LLM ouverts modernes, mettant en lumière les innovations clés : l'attention latente multi-têtes (MLA) et le mélange d'experts (MoE) dans DeepSeek V3, ainsi que les caractéristiques de normalisation dans OLMo 2. L'article couvre l'évolution de GPT-2 aux modèles de 2025.

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka27.07 · 18:04
Recherche 🇺🇸

Au-delà des LLM standard : hybrides d’attention linéaire, modèles de diffusion de texte, modèles de monde de code et petits transformeurs récurrents

L’article explore des alternatives aux LLM standards basés sur l’attention autorégressive des transformeurs : les hybrides d’attention linéaire (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), les modèles de diffusion de texte, les modèles de monde de code et les petits transformeurs récurrents. L’auteur note un retour à l’attention classique dans MiniMax-M2 et la complexité de l’attention linéaire en production.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
Infos fraîches