Monotonicity as an Architectural Bias for Robust Language Models
单调性作为提升语言模型鲁棒性的架构偏倚
机构 * Department of Computer Science, University of Colorado Boulder, Boulder, CO, USA(计算机科学系,科罗拉多大学波尔德分校,波尔德,科罗拉多州,美国)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过在Transformer模型中引入单调性约束,提升语言模型对对抗攻击的鲁棒性,同时保持预训练性能。
Comments 12 pages, 1 figure