研究 🇷🇺 10.08.2026 14:03

拡散言語モデル:その仕組み、有効な点、そして疑問点

СберСбер OpenAIOpenAI MicrosoftMicrosoft
拡散言語モデル(dLLM)は、テキストを並列に生成し、シーケンス内の任意の場所のマスクを埋めます。並列生成、テキスト補完、逆クエリに対する堅牢性などの利点がある一方で、メモリ効率の悪さや固定長生成などの課題も抱えています。本記事では、LLaDA、Plaid、フローマッチング法などの最近の研究を取り上げ、事前学習済み自己回帰モデルの適応についても探ります。
拡散言語モデル(dLLM)は、左から右へトークンを順次生成する自己回帰LLMとは異なり、並列にテキストを生成し、どこでもマスクを埋める。BERTに関連するマスク拡散アプローチは、トークンをMASKに置き換える前向きプロセスと、それを復元する逆向きプロセスを使用する。利点には、並列生成、テキスト補完、逆方向クエリへの頑健性(LLaDAが示す)、限られたデータでの性能向上が含まれる。しかし、dLLMはKVキャッシュの非効率性、トークン独立性の仮定、固定長生成に悩まされ、可変長には工夫が必要である。評価ではしばしば perplexity(GenPPL)が用いられるが、反復崩壊に悩まされるため、多様性指標も必要である。事前学習済み自己回帰モデルのdLLMへの適応は標準的なアプローチであり、DiffuGPT、DiffuLLaMA、Dream、LLaDAなどの手法がある。LLaDAはLing 2.0で継続事前学習され、160億パラメータと1000億パラメータに達した。記事では著者自身の実験と課題にも言及している。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース