PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
机构 * Texas A&M University(德克萨斯A&M大学) ; Inria(法国国家信息与自动化研究所)
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)