Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation
通过价值去相关与外推实现大语言模型的多值对齐
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)
AI总结 本文提出多值对齐框架MVA,通过价值去相关与外推策略,有效解决多价值观对齐中的稳定性与冲突处理问题,实验表明其在多值对齐任务中表现优于现有方法。
Comments accepted by AAAI26 oral; 12 pages