arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

工具调用、任务执行、编程与多智能体协作。

2608.17528 Agent

微软等发布Agent Lightning 1.0:6000条样本把编程智能体提升14.6个百分点

训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型

微软、复旦大学、浙江大学、爱丁堡大学等
文章封面
2608.18034 Agent

浙大&上交提出DAS:让智能体闭环写综述,30个主题总分拿下4.34

自动生成综述最容易出现的不是少写一篇论文,而是分类、论点、引用和段落之间彼此脱节。浙江大学、上海交通大学提出Deep Academic Survey(DAS),把论文分析与专题写作拆开,并用可回退的状态记录组织、写作和审校过程。

浙江大学、上海交通大学等
文章封面
2608.15265 Agent

腾讯港科广等让AI从一句话搭3D世界,GPT-5.5等成功率仍低于60%

香港科技大学(广州)和腾讯联合提出VibeWorlding:用户用文字或图片描述场景,智能体自行理解意图、检索3D资产、调整布局,并根据多视角渲染结果继续修改。论文的6828条查询中,GPT-5.5和Qwen3.8-Max成功率都低于60%

香港科技大学(广州)、腾讯等
VibeWorlding智能体调用3D工具构建可交互世界
2608.14718 Agent

蚂蚁清华等发布VideoGAIA:GPT-5.5等前沿模型看视频答题仍低于60%

香港中文大学、蚂蚁集团和清华大学等机构联合发布VideoGAIA,把视频问答从“看完选答案”改成多轮调查:模型要反复观察视频、调用外部工具、搜索开放世界信息并整合证据。271项任务中,包括GPT-5.5和Kimi-K3在内的所有受测模型准确

香港中文大学、蚂蚁集团、清华大学等
VideoGAIA比较单轮视频问答与多轮智能体式视频理解
2608.14354 Agent

华为推出ScienceFlow:AI科研Agent会回退重走,24小时拿下70.22%奖牌率

让AI连续研究24小时,真正棘手的不是多写几段代码,而是路线走偏后能否及时止损、保留好结果并从可靠节点重新出发。华为诺亚方舟实验室推出ScienceFlow,通过可执行状态快照、证据驱动回退和资源感知调度组织长时程科研Agent,在完整ML

华为诺亚方舟实验室等
ScienceFlow为长时程AI科研保存状态并调度实验的封面
2608.14490 Agent

AI边玩边写游戏规则:Twin通关179/183关,基础模型得分从7.8%升至93.3%

斯坦福大学、康奈尔大学等机构的研究者提出Twin。面对从未见过规则的小游戏,它让AI一边试玩、一边把观察到的状态变化写成可执行代码,为每个游戏建立“数字孪生”,先在内存中验证路线,再提交真正计分的动作。在ARC-AGI-3中,Twin总得分

斯坦福大学、康奈尔大学等
Twin观察游戏并建立可执行规则模型的封面
2608.14047 具身智能与机器人

星尘智能&清华等提出ART:机器人现场调用视觉工具,成功率提升20%

机器人遇到昏暗环境、透明物体或精细几何关系时,不一定要让一个大模型硬扛所有视觉难题。星尘智能、清华大学、香港中文大学等团队提出ART,让视觉—语言—动作模型在执行过程中按需调用分割、深度等外部视觉工具。基于3万条工具增强轨迹训练后,ART在

清华大学、香港中文大学等
ART机器人调用视觉工具完成复杂操作的封面
2608.13552 视觉与生成

快手港中文推出PlayWorld:让AI亲自玩9个世界模型,长时空间一致性仍频频翻车

世界模型生成的视频可能每一帧都很漂亮,但让AI玩家转身、开门、绕一圈再回来,房间结构和物体状态还能对得上吗?快手、香港中文大学、香港大学和浙江大学推出PlayWorld,用Agent玩家在171个交互场景里实测9个世界模型,把评估从“看视频

香港中文大学、香港大学、浙江大学等
PlayWorld让AI玩家测试世界模型的文章封面
2608.13558 Agent

牛津NUS提出OmniScientist:AI直接看图听音频做实验,36个案例全部写成论文

把胸片、鸟鸣、显微图、3D结构和运动轨迹交给AI,它能否不靠人类先整理成表格,直接提出假设、运行分析并写成论文?牛津大学与新加坡国立大学提出OmniScientist,在5个学科的36组真实数据上完成从感知到论文的全流程,直接读取原始模态的

新加坡国立大学、牛津大学等
OmniScientist直接处理多模态科学数据的文章封面
2608.13560 Agent

美团北大清华等开源AutoDesign:40分钟把论文做成会议海报,成本不到3美元

把一篇长论文交给AI,它不仅能排出一张会议海报,还会像设计团队一样反复预览、找错、局部修改。美团、北京大学、清华大学、上海交通大学、香港中文大学等团队开源AutoDesign:一次完整运行约40分钟,调用工具253次、完成11次有效编辑,A

美团、北京大学、清华大学、香港中文大学等
AutoDesign自动生成学术会议海报的文章封面
2608.12313 视觉与生成

阿里通义等提出AVA-Encoder:把电影拆成知识图谱,视频Agent可直接查询和编辑

阿里通义、上海科技大学、香港科技大学等团队提出AVA-Encoder,把视频编码成知识图谱,再从图谱重建回视频。图中的文本节点记录镜头层级、状态和剧情信息,资产层链接图像、音频与视频,Agent可以查询人物、定位片段或修改关系,而不必每次重

上海科技大学、香港科技大学等
文章封面
2608.08814 Agent

东大把秋叶原85条街搬进360CityArena,Gemini导航得分仅17.1%

东京大学团队提出360CityArena,用602段360度视频重建东京秋叶原的85条街道,为具身Agent准备了175项城市探索任务。环境保留商店招牌、路口、楼宇和密集街景,不是用简化3D模型搭的规整迷宫。

东京大学等
文章封面
2608.07418 更多前沿

Google DeepMind发表ResidencyRL,临床AI在模拟问诊中获87.6%医生偏好

医疗AI在一道选择题上答对,不代表它能完成一次真正的接诊。Google DeepMind联合多家医院提出ResidencyRL,让模型在最长60轮对话、最多8次工具调用的模拟门诊中练习问诊、检查、诊断、治疗和记录。在97个病例的医生盲评中,

Google DeepMind等
模拟患者病例与临床智能体问诊界面的文章封面
2608.06704 Agent

谷歌WebRider揭开网页智能体假完成:99.2%交差,只有38.8%守规矩

网页智能体点完几下按钮,再返回一句“任务完成”,并不代表它真的按用户要求做对了。谷歌与加州大学洛杉矶分校推出WebRider,在42个真实网站上构造4096份可检查的“意图合同”。最强配置有99.2%的任务能够正常停机,但同时满足全部合同门

谷歌等
网页智能体操作轨迹与人工审核界面的文章封面
2608.05987 Agent

智能体走对100步,奖励该算给哪一步?AgentOPSD把信用分到每轮

智能体完成一段几十轮任务后只得到成功或失败总分,训练算法往往把同一奖励广播给每一步,难以区分真正扭转结果的动作。清华大学、浙江大学和美团提出AgentOPSD,把信用重新分配到每一轮。

清华大学、浙江大学、美团等
智能体走对100步,奖励该算给哪一步?AgentOPSD把信用分到每轮文章封面
↑