Reinforcement learning in safety-critical domains requires maximizing task performance while strictly adhering to safety constraints. Existing safe reinforce…
机构:Princeton
来源:arXiv 2610.12420 | AI4Papers 论文推荐平台