Mistral

Neueste KI-Nachrichten, Modelle und Releases von Mistral. ['AB-UPT', 'Connectors', 'Devstral', 'Devstral 2', 'Devstral 2 Small', 'Devstral Small 2', 'Document AI', 'Emmi AI', 'Forge', 'GyroSwin', 'Leanstral', 'Leanstral 1.5', 'Leanstral (предыдущая версия)', 'Le Chat', 'Le Chat (Vibe)', 'Magistral', 'MiMo-V2-Flash', 'Ministral 3', 'Ministral-3-3B-Instruct-2512', 'Ministral-3-8B-Instruct-2512', 'Ministral 3B', 'Mistral', 'Mistral 3', 'Mistral 7B', 'Mistral-7B', 'Mistral Large', 'Mistral Large 2', 'Mistral Large 3', 'Mistral Medium 3.1', 'Mistral Medium 3.5', 'Mistral Nemo', 'Mistral OCR 3', 'Mistral OCR 4', 'Mistral OCR4', 'Mistral Search Toolkit', 'mistral-small-2603', 'Mistral Small 3', 'Mistral Small 3.1', 'Mistral Small 3.1 24B', 'Mistral-Small-3.1-24B']

Forschung 🇺🇸

Jenseits der Standard-LLMs: Lineare Aufmerksamkeitshybride, Textdiffusionsmodelle, Code-Weltmodelle und kleine rekurrente Transformer

Der Artikel untersucht Alternativen zu standardmäßigen autoregressiven Transformer-basierten LLMs: lineare Aufmerksamkeitshybride (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), Textdiffusionsmodelle, Code-Weltmodelle und kleine rekurrente Transformer. Der Autor stellt eine Rückkehr zur klassischen Aufmerksamkeit in MiniMax-M2 und die Komplexität der linearen Aufmerksamkeit in der Praxis fest.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
Aktuelle Nachrichten