提出一种输入侧方法,通过优化流畅提示来抑制大语言模型中的评估意识潜在变量,并发现激活可被抑制但模型行为并未相应改变。
机构:纽约大学
来源:arXiv 2607.25907 | AI4Papers 论文推荐平台