From Concept-Aligned Tokens to Vulnerable Features: Mechanistic Localization of Jailbreaks
从概念对齐的Token到脆弱特征:越狱的机制定位
机构 * UMBC(马里兰大学伯克利分校) ; Apple(苹果公司)
AI总结 提出一种基于Token的机制流水线,通过稀疏自编码器特征子组定位越狱漏洞,发现单个有害Token足以定位脆弱特征,且这些特征集中在中后期层。
大厂专区
从概念对齐的Token到脆弱特征:越狱的机制定位
机构 * UMBC(马里兰大学伯克利分校) ; Apple(苹果公司)
AI总结 提出一种基于Token的机制流水线,通过稀疏自编码器特征子组定位越狱漏洞,发现单个有害Token足以定位脆弱特征,且这些特征集中在中后期层。
反因果域泛化:利用无标签数据
机构 * Apple(苹果公司) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 针对反因果设置下的域泛化问题,提出利用无标签数据估计环境扰动方向,通过惩罚模型对协变量均值和协方差变化的敏感性实现鲁棒性,并提供最坏情况最优性保证。
Comments Accepted at the International Conference on Machine Learning (ICML) 2026