Direct Preference Optimization (DPO) has emerged as an effective approach for aligning large language models (LLMs) with human preferences. However, its adap…
机构:中国科学技术大学
来源:arXiv 2608.19598 | AI4Papers 论文推荐平台