Recent advances in large language model (LLM) pretraining highlight the role of high-quality training data in improving performance. While model-based filter…
机构:洛桑联邦理工
来源:arXiv 2610.11585 | AI4Papers 论文推荐平台