arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

美团&北航等训练旅行规划智能体:最难任务GPT-4.1全约束通过率仅0.5%

作者:arXivDaily编辑部 arXiv 2608.26807 cs · cs.AI · cs.CL

用户只说“规划三天旅行”,没有主动填写酒店档次、饮食口味和景点偏好,智能体还能给出贴合个人习惯的计划吗?美团、北京航空航天大学、北京理工大学等机构提出Behavior2Trip,让模型从历史点击、收藏和预订行为中推断偏好,再调用工具生成行程。

基准包含11400个实例,每个实例平均有39.8条历史行为,覆盖14种属性和5类偏好维度。最难设置下,GPT-4.1的全约束通过率只有0.5%;基于Qwen3-8B训练的B2T-Agent超过所有对照,并在另一套TravelPlanner基准上超过GPT-4.1。

从“你喜欢什么”改成“你过去做过什么”

现有旅行助手通常依赖用户明确写出预算、餐饮和住宿要求,或用多轮对话逐项追问。现实中,许多偏好已经存在于浏览和交易轨迹中:反复查看高星酒店、收藏特定菜系、避开重复景点,都能为规划提供线索。

Behavior2Trip要求智能体把行为轨迹转成偏好画像,再将画像用于检索餐厅、酒店、景点和交通方案。最终行程不仅要符合兴趣,还要满足时间、价格、开放状态和路线等硬约束。

图1:智能体从历史行为中推断餐饮和住宿偏好,并把它们写入三日行程。

11400个实例分成三档难度

数据构建先搭建带真实地点、工具和约束的沙盒,再生成不同长度与复杂度的用户行为。研究者收集智能体的动作链,并通过自动检查与人工复核控制质量。三档任务逐步增加隐含偏好和需要同时满足的限制。

平均39.8条行为并非简单标签列表。智能体需要区分偶然点击与稳定偏好,还要处理历史中互相冲突的线索。论文把偏好一致性、工具调用有效性、计划可执行性和完整约束分别计分,避免一个流畅但不可执行的文本得到高分。

图2:基准经过沙盒构建、行为生成、动作链标注和两阶段质量检查。

B2T-Agent把检索、记忆和强化学习接起来

B2T-Agent会先从轨迹提取偏好,再并行调用外部工具检索候选地点和路线。内部记忆模块保存用户偏好及已完成的日程,减少长链规划中反复搜索或遗忘前面约束的问题。

训练使用分组相对策略优化,并把计划质量、无效动作惩罚等多个信号组合成奖励。与纯ReAct串行调用相比,B2T-Agent能更早固定偏好条件,并在后续步骤复用检索结果。

图3:B2T-Agent结合外部工具、内部记忆和多分量奖励完成旅行规划。

0.5%说明难点在同时满足全部条件

GPT-4.1在最难任务上的全约束通过率仅0.5%,并不表示它完全不会规划旅行,而是很难让酒店、餐饮、景点、时间和交通同时通过检查。单项看似合理的安排,可能因营业时间冲突或路线不可达而使整份计划失败。

Qwen3-8B经过B2T-Agent训练后超过所有基线,并迁移到TravelPlanner取得超过GPT-4.1的结果。论文数据来自一家中国在线旅行平台,用户行为分布和工具环境具有平台特征,跨地区、跨平台表现仍需单独验证。

图4:实验比较不同澄清轮次与行为信息组合下的计划质量,检验减少主动询问的代价。

从研究基准走向可控的产品体验

行为驱动规划可以减少用户重复填写偏好,适合已有订单和收藏记录的旅行平台。产品化时应让用户看到“系统推断了什么”,并允许一键纠正,例如临时不想吃辣或本次不考虑高星酒店,避免旧行为覆盖当前意图。

真实上线还要处理隐私授权、数据保留和偏好过期。论文验证的是沙盒内的约束完成度,不是长期满意度;后续需要观察用户修改率、实际预订转化、行程中断率和隐私控制使用情况。

平台还应区分稳定偏好与本次意图。用户长期收藏亲子酒店,但这次可能独自出差;历史上常去高价餐厅,也可能只是代他人预订。让系统展示关键推断依据,并在高成本预订前请求确认,可以减少行为数据被过度解释。

参考资料

https://arxiv.org/abs/2608.26807

https://github.com/BUAA-IRIP-LLM/Behavior2Trip