arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

California Institute of Technology(加州理工学院)

2026-01-16 至 2026-01-16 共收录 1
2502.01930 2026-01-16 cs.LG cs.AI

Robust LLM Alignment via Distributionally Robust Direct Preference Optimization

通过分布鲁棒直接偏好优化实现鲁棒的大语言模型对齐

Zaiyan Xu, Sushil Vemuri, Kishan Panaganti, Dileep Kalathil, Rahul Jain, Deepak Ramachandran

机构 * Texas A&M University(德克萨斯大学) California Institute of Technology(加州理工学院) Tencent AI Lab(腾讯AI实验室) Google DeepMind(谷歌DeepMind)

AI总结 本文提出Wasserstein DPO和KLDPO算法,通过分布鲁棒优化解决LLM与人类偏好间的分布偏移问题,提升对齐性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏