arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

工具调用、任务执行、编程与多智能体协作。

2609.09410 Agent

网页会搜、SQL会写,顶级AI合起来却只过一半

Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等机构的研究团队制作HybridDeepResearch,让AI必须同时查网页和SQL数据库才能回答380道题。GLM-5.2、Claude Sonnet

Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等
文章封面
2609.08273 Agent

阿里等把智能体记忆砍半,性能还留99.7%、检索快2.24倍

上海交通大学、上海人工智能实验室、阿里巴巴、清华大学联合提出MemForest,把智能体历史记忆按事件组织成树,再逐步合并重复节点。M3-Agent在两项多模态基准上压缩50%记忆后保留99.7%表现,检索加速2.24倍。比例是论文五套基准

上海交通大学、上海人工智能实验室、阿里巴巴、清华大学等
文章封面
2609.09133 Agent

测试写错还不如不测:微软等让代码智能体修复率冲到72.6%

威斯康星大学麦迪逊分校、微软研究院、佐治亚理工学院联合提出ExecCritic,把代码测试和源码修复交给两个分别训练的Qwen角色。两者组合在SWE-bench Verified解决72.6%的任务,比原始无测试基线高11.4个百分点;但质

威斯康星大学麦迪逊分校、微软研究院、佐治亚理工学院等
文章封面
2609.05093 更多前沿

只花27.72美元,AI在15轮内打破10项圆堆积纪录

Practical Systems团队用一个可验证的LLM程序进化循环改写圆堆积求解器,在15轮内以27.72美元模型调用成本,改进Packomania中N=101至114范围的10项已知纪录。结果由零容差检查并被数据库接受,但只针对可变半

Practical Systems等
文章封面
2609.04802 具身智能与机器人

24小时视频压缩26.1倍,南大华为让机器人记住物体去向

南京大学、华为、天津大学与不列颠哥伦比亚大学团队提出语言轨迹编码LTE,把长视频中的物体位置、状态与语义压成可查询记忆。论文报告8.7至26.1倍压缩,24小时视频查询低于1秒;但在SMB上的两类成功率只有45.3%和48.7%,长时记忆远

南京大学、华为、天津大学、不列颠哥伦比亚大学等
文章封面
2609.05374 Agent

电脑智能体少点57%步骤,交大浙大让GUI和命令行一起干活

上海交通大学与浙江大学团队提出CUA-Universe,让同一个电脑智能体在图形界面与命令行之间选择操作。9B模型在OSWorld上的成功率提升16.8个百分点,同时步骤减少57%。结果来自特定虚拟机应用和基准任务,说明混合工具有效,但不等

上海交通大学、浙江大学等
文章封面
2609.03153 视觉与生成

Adobe等让AI给生成视频查物理错误,304条缺陷解释了228条

Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等机构提出VeriPhy,逐条检查生成视频违反了哪项物理要求、错误出现在何时。149段核心视频含304条人工缺陷,它解释了228条,对比评测器为164条;同骨干直接提示也

Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等
文章封面
2609.02088 Agent

百度让网页AI边运行边改:9B模型做到57.52%,超过万亿参数方案

百度、华中科技大学联合提出RILA,让网页生成智能体把代码放进真实浏览器运行,重放参考操作后再按错误反馈修改。配套训练流程把Qwen3.5-9B在IWR-Bench上的得分从40.40%提高到57.52%,高于论文所测的Kimi-K2.6和

百度、华中科技大学等
文章封面
2609.00377 Agent

AI看一遍折纸视频,生成可执行程序,完整序列完成率100%

魏茨曼科学研究所、麻省理工学院提出FoldingAgent,让视觉语言模型从折纸演示视频反推出可执行的参数化折叠程序。在PurelandFold基准上,完整序列完成率为100%,已完成步骤的编译成功率为96%。

魏茨曼科学研究所、麻省理工学院等
文章封面
2608.29621 Agent

快手等让长视频智能体从制作记录里自我改进,复审调用降37%

同济大学、快手科技和复旦大学提出CineForge,让长视频制作智能体从一次次完整制作记录中提炼可复用策略。经过跨故事演化后,CineScope-Metric由4.024提高到4.380,在新故事上的复审大模型调用减少37.0%。

同济大学、快手科技、复旦大学等
长视频制作智能体从完整轨迹中积累经验
2608.30730 Agent

阿里让18款大模型经营一年网店,10万启动金最高变143万

阿里巴巴通义千问团队、香港科技大学和淘宝天猫集团推出E-Commerce Bench,让18款前沿大模型从10万元启动资金出发,连续经营365天线上商店。GPT-5.6 Sol的年末资产最高,均值达到1431425元,但它在欺诈规避维度只排

阿里巴巴通义千问团队、香港科技大学、淘宝天猫集团等
大模型智能体经营线上商店的年度实验
2608.30241 Agent

谷歌等让AI反复改论文图,质量提升最高18.6分

谷歌、北京大学、加州大学洛杉矶分校和伊利诺伊大学厄巴纳-香槟分校联合提出PaperBanana-Interact,让AI像设计协作者一样根据作者反馈反复修改论文图。与多轮基线相比,系统的质量分提高11.9至18.6分,遗忘旧要求的分数下降3

谷歌、北京大学、加州大学洛杉矶分校、伊利诺伊大学厄巴纳-香槟分校等
AI按照反馈多轮修改科学图表
2608.27893 视觉与生成

阿里让AI直接写出可编辑电商广告,设计图变成可执行代码

输入商品图、卖点文案和尺寸要求,模型不再输出一张难修改的扁平图片,而是直接写出可渲染的HTML/CSS广告。阿里巴巴、同济大学等机构提出CommerceVibe,让商品图片保持原样引用,文字以原生元素存在,运营人员可以继续换图、改字和调整布

同济大学、阿里巴巴等
文章封面
2608.28378 Agent

75.9%真实任务不是一句话说完,小米北大让智能体学会追问

智能体训练常把任务写成一条信息完整的指令,真实用户却会追加条件、改变方向,看到工具结果后再指出错误。对1.6万条真实会话的分析显示,75.9%包含两轮或更多用户发言,多轮会话的用户发言中位数达到10轮。

北京大学、小米、香港大学、中国人民大学等
文章封面
2608.26991 Agent

上交&BIGAI提出ASIL:软件智能体从截图点击转向结构化操作

软件智能体常靠截图理解界面,再模拟鼠标点击和键盘输入。上海交通大学、北京通用人工智能研究院提出Agent-Software Interaction Layer,即ASIL,用结构化JSON状态替代像素观察,用可执行语义动作替代坐标点击。

上海交通大学、北京通用人工智能研究院等
文章封面
2608.27371 具身智能与机器人

北理工提出ESRP:让机器人只看第一视角重排5400组房间

给机器人一张目标房间的俯视布局,它需要从第一视角找到家具、抓起、搬运并摆到正确位置。北京理工大学提出具身场景重排规划ESRP,并构建ESRP-Bench,包含超过5400组初始—目标场景和8200个物体。

北京理工大学等
文章封面
↑