香港中文大学和澳门理工大学联合发布了TREK(Travel Reasoning and Evaluation Kit),一个用于评估LLM智能体旅行规划能力的基准。在15个LLM智能体的评估中,即使是最强的GPT-5.6也只在46.2%的可解任务上生成了完全可行的计划,中位数为6.6%,最低值为0.0%。
一个可用的行程,必须同时对多个维度都正确
旅行规划对使用工具的LLM智能体来说是一项严苛的压力测试。一份可用的行程必须同时满足多个条件:每趟航班、酒店和景点必须真实存在且可预订;每天的行程在物理上必须可通行(不能安排两个相距500公里的活动在同一天上午);总费用必须在预算内;计划还要满足旅行者只部分表达出来的偏好。
现有的智能体基准通常是分别对这些属性打分,然后用软性规则或LLM评判来评估最终输出。这种方式无法验证返回的计划是否真的可执行,也不具备可复现性和可审计性。
TREK的设计目标是解决这个问题:用完全确定性的规则评估器,无LLM评判,让每个任务的得分都可复现和可审计。
图:TREK从旅行需求构建、约束检查到多维评估的完整流程。
800个任务,其中267个是可证明不可行的
TREK包含800个多约束任务。其中533个是可行任务,267个是可证明不可行的——每个不可行任务都标注了具体原因,分为路线不可行、实体不存在、预算不足三类。这个设计很关键:智能体不仅需要能解出可行任务,还需要能识别出哪些任务根本无解并给出说明。
任务基于一个合成但内部一致的知识库,包含375个城市、13种旅行者角色,共212530条记录。所有数据通过一个生产级的工具沙盒提供,沙盒中的RESTful API都经过验证。这意味着智能体调用的每个API都会返回真实的、一致的数据。
每个任务由完全确定性的基于规则的评估器打分,覆盖9个约束维度。评估器附带经人工验证的黄金参考答案,该答案在同一评估器下得分1.0——这证明了满分是可达到的,剩余的差距完全是智能体的局限,而非评分标准过于严格。
图:TREK中的可行与不可行旅行规划任务示例。
46.2%、6.6%、0.0%
15个LLM智能体的评估结果揭示了当前能力的真实水平:
- 最强模型GPT-5.6:46.2%的可解任务上生成完全可行计划 - 中位数:6.6% - 最低值:0.0%
从46.2%到6.6%的巨大差距说明,旅行规划能力在不同模型间存在显著分化。而0.0%的存在意味着有些模型完全无法生成任何满足所有约束的计划。
图:不同模型在各类旅行约束上的失败分布。
共同瓶颈:满足没说出口的需求
论文最重要的发现是,满足旅行者未明确表达的需求(unstated persona needs)是所有模型的共同瓶颈,即使在前沿模型上也未得到解决。
TREK的13种角色设定包含了各种隐含偏好——例如一个带小孩的家庭可能没有明说需要"步行距离短的景点",一个商务旅行者可能没说明"住宿靠近会议中心"。人类旅行规划师会自然地推断这些需求,但LLM智能体普遍未能捕捉到。
这个发现指向了一个更深层的能力缺口:智能体在处理显式约束时表现尚可,但在推断隐含需求上仍然薄弱。
图:模型在内容满意度、真实性、规划合理性和效率上的对比。
成本与质量的权衡
论文还分析了成本与规划质量的关系。结果显示,更强的模型通常需要更多的工具调用和更长的推理,成本更高。但成本增加与质量提升并非线性关系——某些中等成本的配置能达到接近顶级模型的效果。
图:不同模型旅行规划质量与推理成本的关系。
完全可复现的基准,以及下一步方向
TREK的数据集、工具沙盒、确定性评估器和智能体代码全部开源,构成一个完全可复现的基准。这在智能体评估领域并不常见——许多基准依赖闭源API或LLM评判,导致结果难以复现。
需要说明的是,TREK基于合成数据构建。真实旅行场景存在更多不确定性:航班可能延误、酒店可能满房、景点可能临时关闭。TREK测试的是在信息完全确定情况下的规划能力,这是必要条件但不是充分条件。
下一步,将真实世界的动态性引入基准,以及针对"隐含需求推断"这一瓶颈设计专门的训练方法,都是明确的方向。