Speculative decoding reduces large language model inference latency by drafting multiple tokens before target-model verification, but its effectiveness depen…
机构:AWS
来源:arXiv 2610.07780 | AI4Papers 论文推荐平台