Post-training has been shown to significantly improve language models' performance on tasks with verifiable outcomes, including mathematical reasoning, softw…
机构:普林斯顿大学
来源:arXiv 2609.36914 | AI4Papers 论文推荐平台