Alignment of large language models with constrained learning
受限学习下的大语言模型对齐
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
AI总结 本文提出了一种基于拉格朗日对偶性的迭代对偶对齐方法,用于在满足约束条件下优化大语言模型策略,通过实验验证了其在受限对齐问题中的有效性。
Comments 51 pages, 5 figures, 11 tables; Accepted to NeurIPS 2025