Improving Large Language Model Safety with Contrastive Representation Learning
通过对比表征学习提升大语言模型安全性
机构 * ETH Zurich(苏黎世联邦理工学院) ; MPI for Intelligent Systems(智能系统最大计划) ; University of Toronto(多伦多大学)
AI总结 本文提出基于对比表征学习的框架,通过三元组损失和对抗性难负样本挖掘提升大语言模型对对抗攻击的鲁棒性。
Comments EMNLP 2025 Main