Large language models (LLMs) typically generate text autoregressively (AR), predicting one token at a time. Block diffusion language models (dLLMs) instead g…
机构:清华
来源:arXiv 2609.35362 | AI4Papers 论文推荐平台