Permutative Preference Alignment from Listwise Ranking of Human Judgments
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; University of Florida(佛罗里达大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments Published at EMNLP 2025 Main Conference