arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

75.9%真实任务不是一句话说完,小米北大让智能体学会追问

作者:arXivDaily编辑部 arXiv 2608.28378 cs · cs.CL

智能体训练常把任务写成一条信息完整的指令,真实用户却会追加条件、改变方向,看到工具结果后再指出错误。对1.6万条真实会话的分析显示,75.9%包含两轮或更多用户发言,多轮会话的用户发言中位数达到10轮。

北京大学、小米、香港大学、中国人民大学等机构提出PersonaForge,用可控的模拟用户与智能体持续对话,再把轨迹用于训练和评测。论文报告,MiMo-V2-Flash训练后的综合分从60.4%升至76.1%,绝对提高15.7个百分点;这一成绩依赖模拟用户和模型裁判,不能直接等同真实用户满意度。

真实用户会在工具执行后改口

研究团队比较了单轮与多轮会话。多轮会话平均长度约21.2万字符,是单轮的4.7倍;38.7%的多轮会话包含明确纠错,单轮仅2.0%。在所有纠错中,36.0%发生在工具已经执行之后。智能体不仅要理解新要求,还要判断前一步结果是否仍然可用。

图1:真实会话按任务类别统计的多轮占比,数据分析与系统开发较高,信息检索较低。

现有工具调用数据通常先写好完整目标,再离线生成一条理想轨迹。这样的样本很少覆盖“用户没说清楚”“执行后发现方向不对”“格式不符合交付要求”等情况。部署中最费时间的部分,恰好常在这些来回修正里。

图2:真实会话包含追加条件、方向调整和工具执行后的纠错,不是固定脚本的单轮问答。

四维角色卡控制模拟用户

PersonaForge为模拟用户建立四维角色空间:职业、熟练度、知识背景和人格倾向。SOUL行为控制模块把提问长度、耐心、反馈方式和纠错概率校准到真实统计,避免所有模拟用户都用同一种措辞、一次性说完所有信息。

种子任务来自真实查询,再通过“反向深度构造”还原一个逐步披露的用户目标。模拟用户只掌握自己角色范围内的信息,根据智能体刚才的回答和工具结果决定下一句;智能体若走错方向,用户可以纠正,而不是照着预写脚本继续。

图3:框架以角色卡和行为控制生成多轮用户,再与智能体交互形成训练轨迹。

6300条训练记录,138项人工标注任务

团队据此构建约6300条训练记录,并制作PersonaForge-Bench。基准含138项人工标注任务,覆盖20多个专业领域,从任务完成、工具合适性、回答质量和交互效率四个维度评分。它不只看最终答案,还检查智能体是否问了必要问题、是否过早调用工具,以及能否根据用户新信息修正计划。

Qwen3.5-27B经PersonaForge训练后,综合分从76.2%升至80.3%,绝对提高4.1个百分点;任务完成和回答质量分别提高6.0和6.8个百分点。MiMo-V2-Flash的综合分提升更大,从60.4%升至76.1%,任务完成维度提高22.0个百分点。不同底座增幅差异明显,训练收益不能直接外推到所有智能体。

下一步:用真实用户检验追问质量

在MiMo-V2-Flash实验中,平均对话轮次从15.2降至11.8,平均工具调用从18.5次降至13.8次,达到25轮上限的案例从133个降至53个。任务完成度同时上升,说明减少的是无效尝试和重复调用,并非简单提前结束对话。

图4:PersonaForge训练后,MiMo-V2-Flash完成任务所需轮次和工具调用减少。

下一步需要把训练好的智能体交给真实用户做盲测,比较澄清问题是否恰当、误调用是否减少,以及长任务失败后能否恢复。若这些指标成立,多轮用户模拟可以进入客服、办公自动化和软件代理的数据管线,用更低成本覆盖真实部署中难以批量收集的追问与纠错轨迹。

评测还应单独记录用户中途放弃、反复改口和权限不足等失败类型,避免综合分上涨掩盖某类真实交互退化。

参考资料

https://arxiv.org/abs/2608.28378

https://arxiv.org/html/2608.28378

https://arxiv.org/pdf/2608.28378