Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance
隐藏在请求中:通过词元相关性解释不道德的大语言模型合规性
机构 * Faculty of Electrical and Computer Engineering, Technion(以色列理工学院电气与计算机工程学院)
AI总结 本研究针对LLMs在不道德场景下的合规性失败问题,提出LRP引导的解码方法,发现模型对提示词元的归因不足是关键原因,干预后可提升响应安全性。