Discrete diffusion language models (dLLMs) expose a denoised solution at every step, which makes process reward model (PRM) guidance look like a way to spend…
机构:北大
来源:arXiv 2609.35472 | AI4Papers 论文推荐平台