Scaling Large Language Models (LLMs) via Mixture-of-Experts (MoE) enables massive parameter growth with nearly constant per-token computation. However, furth…
机构:阿里
来源:arXiv 2609.39137 | AI4Papers 论文推荐平台