Allen Institute for AI

Laatste AI-nieuws, modellen en releases van Allen Institute for AI. ['MolmoAct2', 'OLMo 2', 'OLMo 2 7B', 'OLMo 3', 'OLMo 3 7B', 'Tülu 3']

Modellen 🇺🇸

Vergelijking van Architecturen van Grote Taalmodellen: Van DeepSeek V3 tot OLMo 2

Sebastian Raschka publiceerde een gedetailleerde vergelijking van de architecturen van moderne open LLM's, waarbij hij belangrijke innovaties belicht: Multi-Head Latent Attention (MLA) en Mixture-of-Experts (MoE) in DeepSeek V3, evenals normalisatiefuncties in OLMo 2. Het artikel behandelt de evolutie van GPT-2 tot modellen uit 2025.

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka27.07 · 18:04
Onderzoek 🇺🇸

Voorbij standaard LLM's: lineaire aandacht hybriden, tekst diffusiemodellen, code wereldmodellen en kleine recurrente transformatoren

Het artikel onderzoekt alternatieven voor standaard autoregressieve transformer-gebaseerde LLM's: lineaire aandacht hybriden (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), tekst diffusiemodellen, code wereldmodellen en kleine recurrente transformatoren. De auteur merkt een terugkeer naar klassieke aandacht op in MiniMax-M2 en de complexiteit van lineaire aandacht in productie.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
Vers nieuws