IBM

Neueste KI-Nachrichten, Modelle und Releases von IBM. ['ChartNet', 'Granite 4.0', 'Granite-Docling-258M', 'Granite Speech', 'Granite Speech 4.0 1B', 'Granite Speech 4.1 2B', 'Granite Speech 4.1 2B-NAR', 'Granite-Vision-3.3-2B', 'IBM gender classifier', 'сверхпроводящий квантовый компьютер IBM']

Forschung 🇺🇸

Jenseits der Standard-LLMs: Lineare Aufmerksamkeitshybride, Textdiffusionsmodelle, Code-Weltmodelle und kleine rekurrente Transformer

Der Artikel untersucht Alternativen zu standardmäßigen autoregressiven Transformer-basierten LLMs: lineare Aufmerksamkeitshybride (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), Textdiffusionsmodelle, Code-Weltmodelle und kleine rekurrente Transformer. Der Autor stellt eine Rückkehr zur klassischen Aufmerksamkeit in MiniMax-M2 und die Komplexität der linearen Aufmerksamkeit in der Praxis fest.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
Aktuelle Nachrichten