MallitTutkimus 🇺🇸 28.07.2026 00:02

Avoimien LLM:ien kevät: 10 arkkitehtuuria tammi–helmikuussa 2026

Arcee AIArcee AI Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen MiniMaxMiniMax CohereCohere
Katsaus kymmeneen avoimeen LLM:ään keväältä 2026, keskittyen arkkitehtuurien yhtäläisyyksiin ja eroihin. Keskeisiä malleja ovat Trinity Large, Kimi K2.5, Step 3.5 Flash, Qwen3-Coder-Next ja muut.
Kirjoittaja esittelee kymmenen tammi-helmikuussa 2026 julkaistun avoimen suuren kielimallin arkkitehtuurisia yksityiskohtia. Arcee AI julkaisi Trinity Largen (400B MoE, 13B aktiivista), jossa on paikallis-globaali huomio (3:1), QK-normi, NoPE, portitettu huomio ja neljä RMSNorm-kerrosta. Moonshot AI esitteli Kimi K2.5:n (1 biljoona parametria) – multimodaalisen laajennuksen K2:een, joka on koulutettu 15 biljoonalla visuaalisella ja teksti-tokenilla varhaisella fuusiolla. Step 3.5 Flash StepFunilta (196B MoE, 11B aktiivista) saavutti 100 tokenia sekunnissa 128 000 tokenin kontekstipituudella käyttäen MTP-3:a. Qwen3-Coder-Next (80B, 3B aktiivista) ylitti suuremmat mallit koodaustehtävissä hybridin Gated DeltaNet ja Gated Attention (3:1) ansiosta. Mainitaan myös GLM-5 z.AI:lta, MiniMax M2.5, Nanbeige 4.1 3B, Qwen 3.5, Ling 2.5 ja Ring 2.5 Ant Groupilta, Tiny Aya Coherelta sekä Sarvam 30B ja 105B -mallit.
Lähde: Sebastian Raschka — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset