Allen Institute for AI

Últimas noticias, modelos y lanzamientos de IA de Allen Institute for AI. ['MolmoAct2', 'OLMo 2', 'OLMo 2 7B', 'OLMo 3', 'OLMo 3 7B', 'Tülu 3']

Modelos 🇺🇸

Comparación de arquitecturas de modelos de lenguaje grandes: desde DeepSeek V3 hasta OLMo 2

Sebastian Raschka publicó una comparación detallada de las arquitecturas de los LLM abiertos modernos, destacando innovaciones clave: Multi-Head Latent Attention (MLA) y Mixture-of-Experts (MoE) en DeepSeek V3, así como características de normalización en OLMo 2. El artículo cubre la evolución desde GPT-2 hasta los modelos de 2025.

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka27.07 · 18:04
Investigación 🇺🇸

Más allá de los LLM estándar: híbridos de atención lineal, modelos de difusión de texto, modelos de mundo de código y pequeños transformers recurrentes

El artículo explora alternativas a los LLM estándar basados en transformers autorregresivos: híbridos de atención lineal (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), modelos de difusión de texto, modelos de mundo de código y pequeños transformers recurrentes. El autor señala un retorno a la atención clásica en MiniMax-M2 y la complejidad de la atención lineal en producción.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
Noticias frescas