SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
SafeDPO: 一种简单的方法用于直接偏好优化并增强安全性
机构 * LG AI Research(LG人工智能研究)
AI总结 SafeDPO通过简单理论驱动的目标,实现轻量级且有效的安全对齐,提升安全性的同时保持有用性。
Comments 40 pages
Journal ref In Proceedings of the International Conference on Learning Representations (ICLR), 2026