Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory
通过上下文学习理论理解并改进LLMs的连续对抗训练
机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) ; King Abdullah University of Science and Technology(卡布斯大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文基于上下文学习理论,首次对LLMs的连续对抗训练进行了理论分析,提出通过引入奇异值正则化项提升对抗训练的鲁棒性与实用性。
Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)