Sparse Mixture-of-Experts models scale parameter capacity efficiently while maintaining a fixed compute budget per token. However, traditional training parad…
机构:上智院
来源:arXiv 2610.11575 | AI4Papers 论文推荐平台