Allen Institute for AI

Neueste KI-Nachrichten, Modelle und Releases von Allen Institute for AI. ['MolmoAct2', 'OLMo 2', 'OLMo 2 7B', 'OLMo 3', 'OLMo 3 7B', 'Tülu 3']

Modelle 🇺🇸

Vergleich der Architekturen großer Sprachmodelle: Von DeepSeek V3 bis OLMo 2

Sebastian Raschka veröffentlichte einen detaillierten Vergleich der Architekturen moderner offener großer Sprachmodelle und hob dabei wichtige Innovationen hervor: Multi-Head Latent Attention (MLA) und Mixture-of-Experts (MoE) in DeepSeek V3 sowie Normalisierungsmerkmale in OLMo 2. Der Artikel behandelt die Entwicklung von GPT-2 bis zu Modellen aus dem Jahr 2025.

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka27.07 · 18:04
Forschung 🇺🇸

Jenseits der Standard-LLMs: Lineare Aufmerksamkeitshybride, Textdiffusionsmodelle, Code-Weltmodelle und kleine rekurrente Transformer

Der Artikel untersucht Alternativen zu standardmäßigen autoregressiven Transformer-basierten LLMs: lineare Aufmerksamkeitshybride (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), Textdiffusionsmodelle, Code-Weltmodelle und kleine rekurrente Transformer. Der Autor stellt eine Rückkehr zur klassischen Aufmerksamkeit in MiniMax-M2 und die Komplexität der linearen Aufmerksamkeit in der Praxis fest.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
Aktuelle Nachrichten