Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
一次对齐,多语言受益:为LLM安全对齐强制多语言一致性
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; National University of Singapore(新加坡国立大学) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
AI总结 本文提出一种资源高效的多语言一致性对齐方法,通过多语言一致性损失实现多语言同时对齐,提升跨语言安全性和泛化能力。
Comments Accepted by ICLR 2026