arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华等团队发现,给大模型一份工具说明可能削弱拒答信号

arXiv 2607.29254 cs.AI

北京邮电大学、北京航空航天大学和清华大学研究人员发现,同一条危险请求加入结构化工具说明后,模型内部区分有害与无害输入的能力明显下降。Llama的AUROC从0.927降至0.740,Qwen从0.901降至0.786,Mistral从0.921降至0.815。

长度不是主要原因。把普通聊天输入补到相近长度后,三款模型的AUROC仍为0.916、0.867和0.904。变化主要出现在JSON Schema一类结构化工具规范加入上下文之后。

工具说明改变了模型对请求的表示

论文先逐项向聊天输入添加角色说明、工具使用指令和工具规范。角色和一般指令只带来小幅变化,最后加入结构化参数、类型与必填字段时,有害请求和无害请求在隐藏状态中的分离明显减弱。

研究人员把JSON工具说明转换成普通自然语言,Llama、Qwen和Mistral的AUROC分别回升到0.885、0.845和0.898。保留结构、只随机替换字段语义则没有同样效果,指向格式表示本身。

结构化工具规范转成普通文字的示例

论文图2:SafeKeep在安全判断阶段把Schema摊平成自然语言,执行阶段仍保留原工具格式。

Schema方向与拒答方向相反

团队从隐藏状态中提取一条“Schema方向”,再与聊天模式下的拒答方向比较。多个中后层中,两条方向呈负相关;工具格式越强,生成首个Token时沿拒答方向的投影越弱。

Schema方向和拒答方向的逐层关系

论文图3:结构化工具格式形成的表示方向,在多个层级上与拒答表示相反。

激活操纵实验提供了因果证据。沿相反方向调整后,危险工具执行率可以从95%降至2.5%,但力度过大时无效输出升到77.5%,继续增加则全部输出损坏。直接改模型内部激活不适合作为稳定产品方案。

不同请求和工具格式下的拒答信号投影

论文图4:危险请求加入原始Schema后,首Token的拒答投影被压低。

SafeKeep先用文字版工具做安全判断

研究团队据此设计SafeKeep。系统先把工具规范转成普通文字,让模型只判断当前请求是否安全;通过后,再把原始结构化工具交给正常智能体执行。安全判断和执行使用不同输入表示。

在AgentHarm与InjecAgent上,Llama 3.1 8B的两项攻击成功率分别由22.6%和38.4%降至1.8%和2.2%,任务准确率从52.2%升至79.3%。Qwen3-8B对应攻击成功率从26.8%和56.2%降至6.8%和8.4%,准确率从54.8%升至83.8%。这些数字来自论文设置下的四款模型和两套基准。

安全层仍可能成为新的单点故障

SafeKeep需要模型先正确判断风险。攻击者可以针对文字转换、判定提示或安全模型本身设计绕过方式,额外一次判断也会增加延迟和调用成本。论文没有覆盖所有工具类型、权限系统和真实企业工作流。

结构化Schema是工具调用标准接口,不能简单删除。更实际的做法是把安全决策放到独立层,并用权限、参数验证、沙箱和人工确认共同限制高风险动作,而不是把拒答责任留给同一次生成。

参考资料

https://arxiv.org/abs/2607.29254

https://github.com/snowcatsmoking/SafeKeep