Expert parallelism (EP) enables inference of large Mixture-of-Experts (MoE) models by placing their experts across multiple GPUs, but requires substantial co…
机构:首尔大学
来源:arXiv 2609.40093 | AI4Papers 论文推荐平台