One Model, Multiple Goals: Adaptive Multi-Objective Learning for E-commerce Dialogue Systems
一个模型,多个目标:面向电商对话系统的自适应多目标学习
机构 * ByteDance(字节跳动) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; University of Notre Dame(圣母大学)
AI总结 提出自适应多目标强化学习框架MORE,通过将推理功能作为约束指导策略优化,并引入自适应多奖励机制平衡语言目标,在电商对话系统中同时提升推理准确性和语言自然性,在线实验转化率提升30.09%。
Comments Accepted by KDD 2026