No single way of parallelizing attention serves large language models well under all loads. Low concurrency favors tensor parallelism, many independent reque…
机构:中科院
来源:arXiv 2609.37626 | AI4Papers 论文推荐平台