arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

工具调用、任务执行、编程与多智能体协作。

2608.26807 Agent

美团&北航等训练旅行规划智能体:最难任务GPT-4.1全约束通过率仅0.5%

用户只说“规划三天旅行”,没有主动填写酒店档次、饮食口味和景点偏好,智能体还能给出贴合个人习惯的计划吗?美团、北京航空航天大学、北京理工大学等机构提出Behavior2Trip,让模型从历史点击、收藏和预订行为中推断偏好,再调用工具生成行程

美团、北京航空航天大学、北京理工大学等
文章封面
2608.27456 Agent

美团&上交等打造UrbanGround:把AI智能体放进真实尺度城市

看懂一张街景,并不等于能沿着街道走到目的地。上海交通大学、美团、新加坡国立大学等机构提出UrbanGround,把真实尺度城市地理数据装进可交互的Unity环境,专门检验多模态大模型在连续移动中能否认路、记路并调整路线。

上海交通大学、美团、新加坡国立大学等
文章封面
2608.25061 AI基础设施

IBM让大模型给数据库写GPU算子,22条查询全通过并加速2.11倍

数据库查询搬到GPU后,最慢的热点仍常靠工程师手写CUDA或Triton。IBM Research、维也纳工业大学提出DataKernelBench,把SQL先转成可验证的PyTorch张量计划,再让大模型在保持结果一致的前提下改写GPU内

IBM Research、维也纳工业大学等
文章封面
2608.25622 Agent

vivo、港中大(深圳)等让8B模型规划视频剪辑,得分从0.620升至0.924

“把开场压到3秒、第二段踩音乐重拍、总时长不超过30秒”不是一句文字建议,而是一组必须能落到时间线的操作。港中大(深圳)、vivo AI Lab、北京大学等机构提出RefineCut,训练8B开源权重模型输出剪辑补丁,再由确定性验证器检查每

港中大(深圳)、vivo AI Lab、北京大学等
文章封面
2608.25417 Agent

北大、清华、商汤让AI拿工具精细画图,25个模型相似度最高仅0.54

模型能说出苹果在画面左侧,不代表它能用绘图工具准确圈住苹果。北京大学、清华大学、商汤研究院提出EASEL,要求多模态智能体不断观察参考图和当前画布,再输出笔刷位置、颜色、粗细等参数,直到重建目标。

北京大学、清华大学、商汤研究院等
文章封面
2608.24020 Agent

复旦、字节让AI边看工程图边修CAD代码,可执行率做到99.33%

从带尺寸标注的正交工程图生成CAD代码,早期一个工作平面、孔径或拉伸深度出错,后面所有操作都会跟着偏。复旦大学、字节跳动提出IterCAD,让模型在生成中间CAD后重新查看几何结果,决定继续修改还是停止。

复旦大学、字节跳动等
文章封面
2608.24777 Agent

上海AI实验室等提出StepGuard,智能体攻击成功率降77.3%、效用少2.8点

工具型智能体一旦执行发邮件、改文件或支付等操作,事后识别风险往往已经太晚。上海人工智能实验室、北京航空航天大学、复旦大学、中国人民大学等机构提出StepGuard,在每次工具调用前检查动作,也能对完成后的整条轨迹做审计。

上海人工智能实验室、北京航空航天大学、复旦大学、中国人民大学等
文章封面
2608.24876 Agent

普林斯顿、斯坦福等让智能体递归改记忆,37组长任务实验中35组成功率上升

智能体执行长任务时,聊天记录越来越长,未完成目标容易被淹没,检索到的技能也可能与当前状态错位。新加坡国立大学、斯坦福大学、牛津大学、普林斯顿大学提出Recuris,把工作记忆和经验记忆耦合,并让失败证据反向推动局部技能更新。

新加坡国立大学、斯坦福大学、牛津大学、普林斯顿大学等
文章封面
2608.23691 Agent

剑桥、港大等让AI智能体自由做数学,12道构造题里5道找到新结果

不给AI智能体分配固定角色,也不让中央调度器指定下一步,只提供一个可检验的研究目标,它们会不会自己形成研究路线?来自DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校的研究团队共同提出并评测了开放世界多智能体环境Station。

DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校等
文章封面
2608.23318 Agent

百度&浙大用高斯分布给智能体提示,ALFWorld成功率最高98.4%

长程智能体在强化学习早期很难碰到成功轨迹,一种办法是先替它执行专家轨迹的前半段,再让策略从更接近目标的位置探索。浙江大学、百度、山东大学提出Agent-G2,不再为所有任务固定同一段提示长度,而是按任务从动态高斯分布中采样。Qwen2.5-

浙江大学、百度、山东大学等
文章封面
2608.21460 Agent

Patronus AI记录200小时Figma设计过程,训练智能体学会人类工作流

给模型一张优秀网页截图,它能学到最终像素,却看不到设计师如何选图层、建样式、调整间距、撤销错误。Patronus AI推出FigmaTrace,记录超过200小时的人类Figma操作视频,将其转换为3469条设计轨迹,覆盖126项开放式长程

Patronus AI等
文章封面
2608.21360 大模型

南大&南开等测试实时视频助手:Gemini-3-Pro最高仅得66.4分

普通视频问答只要求模型看完片段再回答,实时助手的建议会改变用户下一步动作。南京大学、南开大学和滑铁卢大学联合构建OmniAssistBench,用连续视频片段测试模型能否记住历史、读懂手势、等待关键事件并在正确时间提醒。榜单中Gemini-

南京大学、南开大学、滑铁卢大学等
文章封面
2608.20614 Agent

NVIDIA实测145个Agent Skill:文档检查过关,不等于运行有效

一个Agent Skill的说明文档格式完整、写得清楚,不代表模型会在真实任务中找到它、按对步骤执行并交付正确结果。NVIDIA提出ACES,把同一任务分别交给“有Skill”和“无Skill”的Agent运行,再计算Skill带来的边际增

NVIDIA等
文章封面
2608.19662 AI基础设施

上交大等提出ReCache,智能体工具调用KV内存减少92.43%

智能体每次回答前都要阅读天气、日历、搜索等工具Schema。工具组合或顺序一变,普通前缀缓存就难以复用之前的KV状态。上海交通大学、东方理工学院、西安交通大学提出ReCache,让每份资源独立编码,并只保留调用需要的字段与注意力路径。

上海交通大学、东方理工学院、西安交通大学等
文章封面
2608.19197 Agent

华盛顿大学等提出SPADE:让智能体自己编环境,工具调用提升13.9分

固定训练题库会被智能体逐渐做熟,继续强化学习只是在重复已经会的任务。华盛顿大学、斯坦福大学、卡内基梅隆大学、麻省理工学院等机构提出SPADE,让同一个模型同时扮演“环境设计者”和“推理智能体”,生成可执行环境并随学习进度调整难度。

华盛顿大学、斯坦福大学、卡内基梅隆大学、麻省理工学院等
文章封面
2608.18852 Agent

小红书、上交提出SkillGate:9B智能体成功率从40.8%升至53.2%

智能体先选对一个Skill文件,后续执行却失败,普通结果奖励会连同正确选择一起惩罚。上海交通大学、小红书提出SkillGate,把“选哪个Skill”和“拿Skill完成任务”分成两条互不重叠的信用通道。五项智能体基准上,9B策略的试验成功

上海交通大学、小红书等
文章封面
2608.18307 Agent

同一个GPT-5 mini只换操作界面,成功率从83.1%跌到48.9%

GPT-5 mini操作同一批网页组件,只把观察与动作方式从无障碍树换成纯截图坐标,任务成功率就从83.1%降到48.9%。杜克大学、亚马逊AGI旧金山实验室提出ComponentBench,把按钮组、筛选表格、拖拽和富文本编辑器等97类组

杜克大学、亚马逊AGI旧金山实验室等
文章封面
2608.17271 Agent

人类撤掉方法指导,AI科研得分近乎腰斩:清华等发布ASI-Bench

给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。

清华大学、麻省理工学院、哈佛大学、微软研究院等
文章封面
↑