Growing large language model applications demand efficient inference. At high concurrency, block-diffusion speculative decoding suffers from verification pad…
机构:上交
来源:arXiv 2609.37532 | AI4Papers 论文推荐平台