We study the learning dynamics of fine-tuning a policy model on self-generated and reward-weighted data, with particular focus on a generalized version of RE…
机构:清华
来源:arXiv 2609.36945 | AI4Papers 论文推荐平台