устойчивость к обратным запросам (как показано в LLaDA) и лучшую производительность при ограниченном объеме данных. Однако dLLM страдают от неэффективности KV-кэша, независимости токенов и генерации фиксированной длины, что требует трюков для переменной длины. Оценка часто использует перплексию (GenPPL), но страдает от коллапса повторений; также необходимы метрики разнообразия. Адаптация предобученных авторегрессионных моделей к dLLM является стандартным подходом, с такими методами, как DiffuGPT, DiffuLLaMA, Dream и LLaDA, которая была продолжена предобучением на Ling 2.0 и достигла 16B и 100B параметров. В статье также упоминаются собственные эксперименты авторов и вызовы.