A language model may behave safely in a single-agent evaluation yet produce vulnerable code when its context suggests that it is part of a multi-agent system…
机构:CMU
来源:arXiv 2610.05793 | AI4Papers 论文推荐平台