Long-context large language model inference is bottlenecked by KV caches that grow linearly with sequence length. This burden is especially severe for long, …
机构:Meta
来源:arXiv 2609.36835 | AI4Papers 论文推荐平台