HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing
HER:面向大语言模型角色扮演的人类级推理与强化学习
机构 * Fudan University(复旦大学) ; MiniMax
AI总结 本文提出HER框架,通过双层推理和人类对齐的奖励模型,提升大语言模型在角色扮演中的认知模拟能力,实验表明其在CoSER和Minimax Role-Play Bench上显著优于基线模型。
Comments Findings of ACL, 2026