美团&北航等训练旅行规划智能体:最难任务GPT-4.1全约束通过率仅0.5%
用户只说“规划三天旅行”,没有主动填写酒店档次、饮食口味和景点偏好,智能体还能给出贴合个人习惯的计划吗?美团、北京航空航天大学、北京理工大学等机构提出Behavior2Trip,让模型从历史点击、收藏和预订行为中推断偏好,再调用工具生成行程
用户只说“规划三天旅行”,没有主动填写酒店档次、饮食口味和景点偏好,智能体还能给出贴合个人习惯的计划吗?美团、北京航空航天大学、北京理工大学等机构提出Behavior2Trip,让模型从历史点击、收藏和预订行为中推断偏好,再调用工具生成行程
看懂一张街景,并不等于能沿着街道走到目的地。上海交通大学、美团、新加坡国立大学等机构提出UrbanGround,把真实尺度城市地理数据装进可交互的Unity环境,专门检验多模态大模型在连续移动中能否认路、记路并调整路线。
长任务中,机器人要记住哪些物体已经移动、当前动作是否失败,以及下一步会不会挡住后续操作。卡内基梅隆大学提出R³,让视觉语言模型在每次低层动作前用自然语言分析场景、进度与替代计划,再把文字指导交给操作策略。
数据库查询搬到GPU后,最慢的热点仍常靠工程师手写CUDA或Triton。IBM Research、维也纳工业大学提出DataKernelBench,把SQL先转成可验证的PyTorch张量计划,再让大模型在保持结果一致的前提下改写GPU内
“把开场压到3秒、第二段踩音乐重拍、总时长不超过30秒”不是一句文字建议,而是一组必须能落到时间线的操作。港中大(深圳)、vivo AI Lab、北京大学等机构提出RefineCut,训练8B开源权重模型输出剪辑补丁,再由确定性验证器检查每
模型能说出苹果在画面左侧,不代表它能用绘图工具准确圈住苹果。北京大学、清华大学、商汤研究院提出EASEL,要求多模态智能体不断观察参考图和当前画布,再输出笔刷位置、颜色、粗细等参数,直到重建目标。
从带尺寸标注的正交工程图生成CAD代码,早期一个工作平面、孔径或拉伸深度出错,后面所有操作都会跟着偏。复旦大学、字节跳动提出IterCAD,让模型在生成中间CAD后重新查看几何结果,决定继续修改还是停止。
工具型智能体一旦执行发邮件、改文件或支付等操作,事后识别风险往往已经太晚。上海人工智能实验室、北京航空航天大学、复旦大学、中国人民大学等机构提出StepGuard,在每次工具调用前检查动作,也能对完成后的整条轨迹做审计。
智能体执行长任务时,聊天记录越来越长,未完成目标容易被淹没,检索到的技能也可能与当前状态错位。新加坡国立大学、斯坦福大学、牛津大学、普林斯顿大学提出Recuris,把工作记忆和经验记忆耦合,并让失败证据反向推动局部技能更新。
不给AI智能体分配固定角色,也不让中央调度器指定下一步,只提供一个可检验的研究目标,它们会不会自己形成研究路线?来自DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校的研究团队共同提出并评测了开放世界多智能体环境Station。
长程智能体在强化学习早期很难碰到成功轨迹,一种办法是先替它执行专家轨迹的前半段,再让策略从更接近目标的位置探索。浙江大学、百度、山东大学提出Agent-G2,不再为所有任务固定同一段提示长度,而是按任务从动态高斯分布中采样。Qwen2.5-
给模型一张优秀网页截图,它能学到最终像素,却看不到设计师如何选图层、建样式、调整间距、撤销错误。Patronus AI推出FigmaTrace,记录超过200小时的人类Figma操作视频,将其转换为3469条设计轨迹,覆盖126项开放式长程
普通视频问答只要求模型看完片段再回答,实时助手的建议会改变用户下一步动作。南京大学、南开大学和滑铁卢大学联合构建OmniAssistBench,用连续视频片段测试模型能否记住历史、读懂手势、等待关键事件并在正确时间提醒。榜单中Gemini-
一个Agent Skill的说明文档格式完整、写得清楚,不代表模型会在真实任务中找到它、按对步骤执行并交付正确结果。NVIDIA提出ACES,把同一任务分别交给“有Skill”和“无Skill”的Agent运行,再计算Skill带来的边际增
智能体每次回答前都要阅读天气、日历、搜索等工具Schema。工具组合或顺序一变,普通前缀缓存就难以复用之前的KV状态。上海交通大学、东方理工学院、西安交通大学提出ReCache,让每份资源独立编码,并只保留调用需要的字段与注意力路径。
固定训练题库会被智能体逐渐做熟,继续强化学习只是在重复已经会的任务。华盛顿大学、斯坦福大学、卡内基梅隆大学、麻省理工学院等机构提出SPADE,让同一个模型同时扮演“环境设计者”和“推理智能体”,生成可执行环境并随学习进度调整难度。
智能体先选对一个Skill文件,后续执行却失败,普通结果奖励会连同正确选择一起惩罚。上海交通大学、小红书提出SkillGate,把“选哪个Skill”和“拿Skill完成任务”分成两条互不重叠的信用通道。五项智能体基准上,9B策略的试验成功
GPT-5 mini操作同一批网页组件,只把观察与动作方式从无障碍树换成纯截图坐标,任务成功率就从83.1%降到48.9%。杜克大学、亚马逊AGI旧金山实验室提出ComponentBench,把按钮组、筛选表格、拖拽和富文本编辑器等97类组
给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。
编程智能体在真实仓库里会压缩上下文、反复调用工具、重启环境,训练器很难精确知道哪些Token由当前策略生成。华为、香港中文大学提出LEGO-RL,在不改动Agent内部控制流的前提下,把OpenHands SDK、Claude Code和O