arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

共 149 篇

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.14022 cs.AI · cs.CV

腾讯港中文等提出ForgeWM:一步生成可玩的游戏世界,回放还能继续精修

扩散世界模型画面越精细,往往要去噪越多步,玩家按键后只能等待;压到一步生成,速度上去了,细节和稳定性又容易下降。腾讯PCG、香港中文大学、复旦大学、上海人工智能实验室、香港科技大学等团队提出ForgeWM,训练1、2、4步不同速度的学生模型

香港中文大学、复旦大学、上海人工智能实验室、香港科技大学等
ForgeWM实时生成Minecraft与射击游戏世界的封面
2608.14379 cs.AI · cs.RO

上交提出ReflexVLA:机器人学会预判运动轨迹,专攻6项高速动态任务

静态桌面上慢慢抓取,模型多想半秒未必出事;面对滚动、摆动或即将离开的目标,等图像编码和动作生成完成,机会已经过去。上海交通大学团队提出ReflexVLA,把未来运动预测、多帧视觉融合和低延迟推理放进同一策略,并发布包含6类高速动态任务的Re

上海交通大学等
ReflexVLA机器人预测动态目标并快速操作的封面
2608.14530 cs.AI · cs.CV

游戏世界穿地怎么办?Marionette把规则写进276维3D状态,错误减少66%

视频模型可以生成很像游戏的画面,却常在连续操控后让角色穿地、漂走或动作失真。Alaya Lab、上海创智学院、华中科技大学等团队提出Marionette,不让神经网络同时猜物理状态和像素,而是先生成276维显式3D角色状态,再由零参数几何桥

华中科技大学等
Marionette用3D角色状态生成可控游戏世界的封面
2608.14354 cs.AI

华为推出ScienceFlow:AI科研Agent会回退重走,24小时拿下70.22%奖牌率

让AI连续研究24小时,真正棘手的不是多写几段代码,而是路线走偏后能否及时止损、保留好结果并从可靠节点重新出发。华为诺亚方舟实验室推出ScienceFlow,通过可执行状态快照、证据驱动回退和资源感知调度组织长时程科研Agent,在完整ML

华为诺亚方舟实验室等
ScienceFlow为长时程AI科研保存状态并调度实验的封面
2608.14490 cs.AI

AI边玩边写游戏规则:Twin通关179/183关,基础模型得分从7.8%升至93.3%

斯坦福大学、康奈尔大学等机构的研究者提出Twin。面对从未见过规则的小游戏,它让AI一边试玩、一边把观察到的状态变化写成可执行代码,为每个游戏建立“数字孪生”,先在内存中验证路线,再提交真正计分的动作。在ARC-AGI-3中,Twin总得分

斯坦福大学、康奈尔大学等
Twin观察游戏并建立可执行规则模型的封面
2608.14403 cs.CV

百度等提出CRAFT:只用1万张参考图训练个性化生成,告别百万合成配对

给AI一张人物、宠物或物品照片,再要求它换姿势、换场景,通常需要大规模合成“参考图—目标图”配对数据。百度、DGIST、KAIST等团队提出CRAFT,只使用1万张彼此独立的参考图训练,不需要预先制作目标合成图,却能同时保持主体身份和文本指

百度、DGIST、KAIST等
CRAFT依据人物宠物和物品参考图生成新场景的封面
2608.14047 cs.AI · cs.CV

星尘智能&清华等提出ART:机器人现场调用视觉工具,成功率提升20%

机器人遇到昏暗环境、透明物体或精细几何关系时,不一定要让一个大模型硬扛所有视觉难题。星尘智能、清华大学、香港中文大学等团队提出ART,让视觉—语言—动作模型在执行过程中按需调用分割、深度等外部视觉工具。基于3万条工具增强轨迹训练后,ART在

清华大学、香港中文大学等
ART机器人调用视觉工具完成复杂操作的封面
2608.13556 cs.CV

视频生成训练快6倍!牛津NUS提出V-RAE,把视觉大模型表征变成视频潜空间

主流视频生成模型通常先训练一个自编码器,把像素压进潜空间,再让扩散模型从头学习其中的语义。牛津大学与新加坡国立大学提出V-RAE,直接复用冻结视觉基础模型的表征来构建视频潜空间,使生成训练最多加快6倍,并在Kinetics-600上取得19

新加坡国立大学、牛津大学等
V-RAE视频重建与生成效果文章封面
2608.13205 cs.CV

Adobe上海AI Lab等开源HPSD:让图生视频当老师,把文生视频自己的基本功教强

图生视频有一张高质量首帧做视觉锚点,通常比只靠一句提示词更容易生成稳定画面。Adobe、上海人工智能实验室、上海交通大学、南洋理工大学和复旦大学等团队开源HPSD,让同一个图文生视频模型先以“带首帧老师”提供高质量方向,再让纯文本学生沿自己

上海交通大学、复旦大学、上海人工智能实验室等
HPSD提升文生视频质量的对比文章封面
2608.13552 cs.CV

快手港中文推出PlayWorld:让AI亲自玩9个世界模型,长时空间一致性仍频频翻车

世界模型生成的视频可能每一帧都很漂亮,但让AI玩家转身、开门、绕一圈再回来,房间结构和物体状态还能对得上吗?快手、香港中文大学、香港大学和浙江大学推出PlayWorld,用Agent玩家在171个交互场景里实测9个世界模型,把评估从“看视频

香港中文大学、香港大学、浙江大学等
PlayWorld让AI玩家测试世界模型的文章封面
2608.13558 cs.AI · cs.CL

牛津NUS提出OmniScientist:AI直接看图听音频做实验,36个案例全部写成论文

把胸片、鸟鸣、显微图、3D结构和运动轨迹交给AI,它能否不靠人类先整理成表格,直接提出假设、运行分析并写成论文?牛津大学与新加坡国立大学提出OmniScientist,在5个学科的36组真实数据上完成从感知到论文的全流程,直接读取原始模态的

新加坡国立大学、牛津大学等
OmniScientist直接处理多模态科学数据的文章封面
2608.13113 cs.AI · cs.CV

看完一个月生活视频,Gemini仍比人类低22.4分!华为南大推出EgoMonth

一个月前把钥匙放在哪、某次做饭先拿了什么、不同日期见过谁——人会把零散经历串成长期记忆,多模态模型却常在短视频问答里被高估。华为、南京大学和天津大学推出EgoMonth,收集20名参与者跨20至120天的300多小时第一视角视频,用1443

南京大学、天津大学等
EgoMonth跨月第一视角视频记忆基准文章封面
2608.13541 cs.CV · cs.GR

华为上交开源SCULPT:3D模型像雕塑一样逐块切开,零件还能无缝装回去

一把电钻不是不可编辑的整体,而应该由机身、电池、钻头等零件组成;这些零件单独看要完整,装回去又不能留下裂缝。华为与上海交通大学团队开源SCULPT,像雕塑家从材料上逐次切割一样,从完整3D形状中迭代取出部件,并根据物体复杂度自动决定零件数量

上海交通大学、华为等
SCULPT把完整3D物体拆成可组装部件的文章封面
2608.13560 cs.AI · cs.CL

美团北大清华等开源AutoDesign:40分钟把论文做成会议海报,成本不到3美元

把一篇长论文交给AI,它不仅能排出一张会议海报,还会像设计团队一样反复预览、找错、局部修改。美团、北京大学、清华大学、上海交通大学、香港中文大学等团队开源AutoDesign:一次完整运行约40分钟,调用工具253次、完成11次有效编辑,A

美团、北京大学、清华大学、香港中文大学等
AutoDesign自动生成学术会议海报的文章封面