Safety alignment of large reasoning models (LRMs) via supervised fine-tuning (SFT) and reinforcement learning (RL) often yields near-perfect safety scores, y…
机构:浙大
来源:arXiv 2609.34896 | AI4Papers 论文推荐平台