Consistency Training Along the Transformer Stack
沿Transformer堆栈的一致性训练
机构 * Purdue University(普渡大学) ; Independent(独立) ; Columbia University(哥伦比亚大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Dartmouth College(达特茅斯学院) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
AI总结 本文通过引入MLP状态和注意力分布的一致性目标,将一致性训练扩展到多种安全威胁,并发现跨威胁泛化及共享机制,证明其作为灵活对齐框架的有效性。
Comments Submitted to EMNLP 2026