Mùa xuân cho các LLM Mở: 10 Kiến trúc trong Tháng 1–2 năm 2026
Arcee AI
Moonshot AI
Alibaba/Qwen
MiniMax
Cohere
Đánh giá mười mô hình ngôn ngữ lớn mở từ mùa xuân năm 2026, tập trung vào điểm tương đồng và khác biệt về kiến trúc. Các mô hình chính bao gồm Trinity Large, Kimi K2.5, Step 3.5 Flash, Qwen3-Coder-Next và các mô hình khác.
Tác giả trình bày tổng quan về mười mô hình ngôn ngữ lớn mã nguồn mở được phát hành trong tháng 1-2 năm 2026, tập trung vào chi tiết kiến trúc. Arcee AI phát hành Trinity Large (400B MoE, 13B active) với cơ chế attention toàn cục-cục bộ (3:1), QK-Norm, NoPE, gated attention và bốn lớp RMSNorm. Moonshot AI giới thiệu Kimi K2.5 (1 nghìn tỷ tham số) – phiên bản mở rộng đa phương thức của K2 được huấn luyện trên 15 nghìn tỷ token hình ảnh và văn bản với cơ chế kết hợp sớm (early fusion). Step 3.5 Flash từ StepFun (196B MoE, 11B active) đạt 100 token mỗi giây với độ dài ngữ cảnh 128k nhờ MTP-3. Qwen3-Coder-Next (80B, 3B active) vượt trội hơn các mô hình lớn hơn trong tác vụ mã hóa nhờ sự kết hợp giữa Gated DeltaNet và Gated Attention (3:1). Ngoài ra còn có GLM-5 từ z.AI, MiniMax M2.5, Nanbeige 4.1 3B, Qwen 3.5, Ling 2.5 và Ring 2.5 từ Ant Group, Tiny Aya từ Cohere, cũng như các mô hình Sarvam 30B và 105B.
Nguồn: Sebastian Raschka —
bản gốc
