Nghiên cứu 🇷🇺 10.08.2026 14:03

Mô hình ngôn ngữ Diffusion: Cách chúng hoạt động, điều gì hiệu quả và điều gì đặt ra câu hỏi

СберСбер OpenAIOpenAI MicrosoftMicrosoft
Mô hình ngôn ngữ Diffusion (dLLM) tạo văn bản song song, điền vào các vị trí trống bất kỳ trong chuỗi. Chúng mang lại lợi thế như tạo văn bản song song, điền văn bản và khả năng chịu đựng với các truy vấn ngược, nhưng gặp phải các vấn đề như kém hiệu quả về bộ nhớ và tạo văn bản có độ dài cố định. Bài viết thảo luận về nghiên cứu gần đây, bao gồm LLaDA, Plaid và các phương pháp khớp dòng chảy (flow-matching), đồng thời khám phá việc chuyển đổi các mô hình tự hồi quy được huấn luyện sẵn.
Các mô hình ngôn ngữ khuếch tán (diffusion language models – dLLM) tạo văn bản theo cách song song, điền vào các khoảng trống (mask) ở bất kỳ vị trí nào, khác với các LLM tự hồi quy (autoregressive) tạo văn bản từng token theo thứ tự từ trái sang phải. Phương pháp khuếch tán có che (masked diffusion), có liên quan đến BERT, sử dụng một quá trình thuận (forward process) để thay thế các token bằng MASK và một quá trình nghịch (reverse process) để khôi phục chúng. Những ưu điểm của phương pháp này bao gồm khả năng tạo văn bản song song, điền văn bản (text infilling), khả năng chống chịu tốt với các truy vấn nghịch (như đã được LLaDA chứng minh), và hiệu suất tốt hơn khi dữ liệu hạn chế. Tuy nhiên, dLLM lại gặp phải các vấn đề như kém hiệu quả về bộ nhớ đệm khóa-giá trị (KV-cache), giả định về tính độc lập giữa các token, và việc tạo văn bản với độ dài cố định, đòi hỏi phải áp dụng các kỹ thuật riêng để xử lý độ dài thay đổi. Việc đánh giá thường sử dụng độ rối loạn sinh (Generation Perplexity – GenPPL) nhưng lại gặp vấn đề sụp đổ do lặp lại (repetition collapse); do đó cần thêm các thước đo về tính đa dạng. Việc điều chỉnh (adaptation) các mô hình tự hồi quy đã được huấn luyện trước thành dLLM là một phương pháp tiêu chuẩn, với các kỹ thuật như DiffuGPT, DiffuLLaMA, Dream, và LLaDA – mô hình đã được tiếp tục huấn luyện trước (continued pretrained) trên Ling 2.0 để đạt quy mô 16 tỷ và 100 tỷ tham số. Bài viết cũng đề cập đến các thí nghiệm và thách thức riêng của các tác giả.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới