LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
LLM-VA: 通过向量对齐解决对抗性回应与过度拒绝的权衡
机构 * Zhejiang University(浙江大学) ; Griffith University(格里菲斯大学) ; Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(title);safety(abstract);分类 cs.AI、cs.LG
AI总结 LLM-VA通过向量对齐解决大型语言模型在对抗性回应与过度拒绝间的权衡问题,提升安全性和效用。