2512.10575
2025-12-12
cs.CL
57%
RoleRMBench & RoleRM: Towards Reward Modeling for Profile-Based Role Play in Dialogue Systems
RoleRMBench & RoleRM:迈向基于角色扮演的对话系统奖励建模
Hang Ding, Qiming Feng, Dongqi Liu, Qi Zhao, Tao Yao, Shuo Wang, Dongsheng Chen, Jian Li, Zhenye Gan, Jiangning Zhang, Chengjie Wang, Yabiao Wang
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Fudan University(复旦大学)
;
Saarland University(萨尔兰州大学)
;
Tencent Youtu Lab(腾讯优图实验室)
专题命中
偏好对齐
:alignment(abstract);分类 cs.CL
AI总结
RoleRMBench与RoleRM旨在通过连续隐式偏好训练提升角色扮演对话系统中奖励建模的准确性与连贯性。