Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
不要执着于提示:针对LLM代理的推理劫持与约束紧缩
机构 * School of Software, Henan University(河南大学软件学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出JailAgent框架,通过触发提取、推理劫持和约束紧缩三个阶段,避免修改用户提示,提升跨模型和跨场景的性能。