Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization
基于概率偏好基的不确定性感知变分奖励分解用于大语言模型个性化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Korea University(高丽大学)
AI总结 本文提出变分奖励分解框架,通过概率偏好基和变分分布实现用户偏好建模,提升LLM个性化效果。
Comments COLM'26