Reinforcement learning from human feedback (RLHF) aligns large language models (LLMs) with human preferences, yet most pipelines learn a single reward model …
机构:浙大
来源:arXiv 2609.35109 | AI4Papers 论文推荐平台