VA-DPO: Valence-Arousal Direct Preference Optimization for Controllable Emotion Generation in Language Models
VA-DPO:用于语言模型可控情感生成的效价-唤醒直接偏好优化
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对现有情感生成无法表达细粒度情感的问题,提出VA-DPO方法,通过效价-唤醒连续目标优化LoRA适配器,在多模型上实现细粒度情感生成且不损害通用性能。
Comments 9 pages, 1 figure, 5 tables