연구 🇷🇺 10.08.2026 14:03

확산 언어 모델: 작동 방식, 효과적인 점, 그리고 의문을 제기하는 점

СберСбер OpenAIOpenAI MicrosoftMicrosoft
확산 언어 모델(dLLM)은 시퀀스의 어디든 마스크를 채우며 텍스트를 병렬로 생성합니다. 병렬 생성, 텍스트 중간 삽입, 역방향 쿼리에 대한 견고성 등의 장점을 제공하지만, 메모리 비효율성과 고정 길이 생성과 같은 문제에 직면합니다. 이 기사는 LLaDA, Plaid 및 흐름 매칭 방법을 포함한 최근 연구를 논의하고 사전 훈련된 자회귀 모델의 적응을 탐구합니다.
확산 언어 모델(dLLM)은 병렬로 텍스트를 생성하며, 어디든 마스크를 채울 수 있습니다. 이는 왼쪽에서 오른쪽으로 토큰 단위로 생성하는 자기회귀 언어 모델과 대조적입니다. 마스크 확산 접근 방식은 BERT와 관련이 있으며, 토큰을 마스크로 대체하는 전방 과정과 이를 복원하는 역방향 과정을 사용합니다. 장점으로는 병렬 생성, 텍스트 중간 채우기, 역방향 쿼리에 대한 견고성(LLaDA에서 입증됨), 그리고 제한된 데이터에서 더 나은 성능이 있습니다. 그러나 dLLM은 KV-캐시 비효율성, 독립 토큰 가정, 고정 길이 생성 등의 단점이 있어 가변 길이를 처리하려면 추가 기법이 필요합니다. 평가는 종종 perplexity(GenPPL)를 사용하지만 반복 붕괴 문제가 있으며, 다양성 지표도 필요합니다. 사전 학습된 자기회귀 모델을 dLLM으로 적응시키는 것이 일반적인 접근 방식이며, DiffuGPT, DiffuLLaMA, Dream, LLaDA와 같은 방법이 있습니다. LLaDA는 Ling 2.0에서 계속 사전 학습되어 160억 개와 1000억 개의 매개변수로 확장되었습니다. 기사는 또한 저자들의 자체 실험과 도전 과제를 언급합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스