研究 🇷🇺 10.08.2026 14:03

扩散语言模型:工作原理、有效实践与待解问题

СберСбер OpenAIOpenAI MicrosoftMicrosoft
扩散语言模型(dLLM)并行生成文本,可在序列任意位置填充掩码。它们具备并行生成、文本填充和对反向查询的鲁棒性等优势,但面临内存效率低下和固定长度生成等问题。文章讨论了近期研究,包括LLaDA、Plaid和流匹配方法,并探讨了对预训练自回归模型的适配。
扩散语言模型(dLLMs)并行生成文本,可任意位置填充掩码,而自回归LLMs则从左至右逐 token 生成。掩码扩散方法(与BERT相关)使用前向过程用掩码替换 token,以及反向过程恢复它们。其优势包括并行生成、文本填充、对逆向查询的鲁棒性(如LLaDA所示),以及数据有限时的更好性能。然而,dLLMs面临KV缓存效率低下、独立token假设及固定长度生成等问题,需通过技巧处理变长生成。评估常采用困惑度(GenPPL),但存在重复坍塌问题;还需多样性指标。将预训练的自回归模型改编为dLLMs是标准方法,采用如DiffuGPT、DiffuLLaMA、Dream及LLaDA等手段,LLaDA在Ling 2.0上继续预训练达到了160亿和1000亿参数。文章还提及了作者自身的实验和挑战。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻