Nghiên cứuMô hình 🇺🇸 27.07.2026 17:03

Tình hình phát triển mô hình ngôn ngữ lớn (LLM) năm 2025: Tiến bộ, thách thức và dự báo

DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
Năm 2025, sự phát triển của mô hình ngôn ngữ lớn (LLM) bị chi phối bởi các mô hình lý luận sử dụng học tăng cường với phần thưởng có thể xác minh (RLVR) và thuật toán GRPO, được khơi mào bởi DeepSeek R1. Các xu hướng chính bao gồm tập trung vào mở rộng thời gian suy luận, kiến trúc hỗn hợp chuyên gia (MoE) và các cải tiến hiệu suất như Gated DeltaNets. Nghiên cứu học thuật nổi bật với các biến thể GRPO có cải tiến như lọc gradient bằng không và mất mát cấp độ token.
Khi năm 2025 kết thúc, năm này bị chi phối bởi các mô hình suy luận sử dụng RLVR và GRPO, sau khi DeepSeek R1 ra mắt vào tháng Giêng. DeepSeek R1 cho thấy hành vi suy luận có thể được phát triển thông qua học tăng cường, và mô hình trọng số mở của nó có hiệu suất tương đương với các mô hình độc quyền. Bài báo cũng làm dấy lên tranh luận về chi phí huấn luyện, với ước tính khoảng 5 triệu đô la cho lần chạy cuối cùng, mặc dù không bao gồm lương của các nhà nghiên cứu. RLVR sử dụng phần thưởng có thể kiểm chứng (ví dụ: toán học, mã nguồn) cho quá trình hậu huấn luyện, giảm sự phụ thuộc vào nhãn dán đắt đỏ của con người. Mọi nhà phát triển mô hình ngôn ngữ lớn (LLM) chính đều phát hành một biến thể suy luận. Các điểm tập trung khác: RLHF+PPO năm 2022, LoRA SFT năm 2023, huấn luyện trung gian năm 2024. Dự đoán cho năm 2026-2027 bao gồm các mở rộng RLVR, mở rộng quy mô suy luận theo thời gian suy luận và học liên tục. GRPO đã trở thành một đối tượng nghiên cứu được yêu thích, với nhiều cải tiến toán học như lọc gradient bằng không, lấy mẫu chủ động, mất mát ở mức token và không dùng mất mát KL, giúp cải thiện đáng kể độ ổn định huấn luyện. Về mặt kiến trúc, các mô hình tiên tiến nhất vẫn sử dụng transformer dạng giải mã với các lớp MoE và cơ chế chú ý hiệu quả (chú ý theo nhóm truy vấn, chú ý cửa sổ trượt, chú ý ẩn đa đầu). Các cải tiến hiệu quả mới hơn bao gồm Gated DeltaNets trong Qwen3-Next và Kimi Linear, và các lớp Mamba-2 trong Nemotron 3 của NVIDIA.
Nguồn: Sebastian Raschka — bản gốc
Bài viết liên quan trước đây ↓
Tin mới