Alignment-Aware Model Adaptation via Feedback-Guided Optimization
通过反馈引导优化实现对齐感知的模型适应
机构 * Department of Computer Science, University of British Columbia, Location, Canada(不列颠哥伦比亚大学计算机科学系) ; Vector Institute of AI, Toronto, Canada(人工智能向量研究所) ; Stony Brook University, New York, USA(石溪大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.LG
AI总结 本文提出了一种通过反馈引导优化实现对齐感知的模型适应框架,通过自适应门控机制平衡监督与对齐梯度,减少有害输出并提升模型对齐性。