arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

图像、视频、三维重建与视觉内容生成。

2608.17420 自动驾驶

清华&长城汽车等提出SPVC:修好跨数据集驾驶视频里的结构错位

自动驾驶仿真把相机移到训练轨迹之外,3D高斯溅射生成的道路、建筑和车道线容易变形;向场景插入车辆后,前景还可能与背景错位。清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等机构提出SPVC,用一套两阶段视频扩散模型修复跨数据集驾

清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等
文章封面
2608.17995 AI基础设施

阿里云&上交等提出AViTS:只放大关键Token,扩散模型最高加速14.76倍

扩散模型从低分辨率切到高分辨率时,通常会把所有潜在Token一起放大,即使大片背景已经稳定。上海交通大学、山东大学、阿里云、西安交通大学等机构提出AViTS,依据文本相关性和跨去噪步骤的特征变化,只优先细化真正重要的Token。

上海交通大学、山东大学、阿里云、西安交通大学等
文章封面
2608.18077 具身智能与机器人

英伟达等提出Hydra-0:把机器人动作变成像素流,运动误差降低90.4%

机器人换一副机械臂,原有世界模型往往就要重新学习动作含义。英伟达、布朗大学、哥伦比亚大学、哈佛大学等机构提出Hydra-0,把关节角、末端位姿等机器人专属命令转换成画面中的像素运动轨迹,让不同形态的机器人共享一种视觉动作接口。

英伟达、布朗大学、哥伦比亚大学、哈佛大学等
文章封面
2608.15555 视觉与生成

剑桥RigidBench测8款视频模型:没有一个在10项物理指标上全面领先

剑桥大学团队提出RigidBench,用模拟器给视频生成模型建立可核对的刚体运动标准答案。8款模型在同一批100个样本上接受10项测量,没有一个模型在全部指标领先;更反常的是,模型平均SSIM越高,3D轨迹误差反而越大,相关系数达到0.89

剑桥大学等
RigidBench用包含多个刚体的场景检查视频模型物理运动
2608.14783 视觉与生成

上海AI Lab复旦中科大等让AI生成300零件3D物体,序列最长25.6万Token

上海人工智能实验室、复旦大学和中国科学技术大学等机构联合提出MegaParts,用自回归大模型生成由语义零件组成的3D物体。系统支持最多300个部件、最长25.6万Token序列,生成的门、抽屉、钢琴键等部件保持独立,便于后续移动、替换和制

上海人工智能实验室、复旦大学、中国科学技术大学等
MegaParts生成包含大量可编辑零件的复杂3D物体
2608.15265 Agent

腾讯港科广等让AI从一句话搭3D世界,GPT-5.5等成功率仍低于60%

香港科技大学(广州)和腾讯联合提出VibeWorlding:用户用文字或图片描述场景,智能体自行理解意图、检索3D资产、调整布局,并根据多视角渲染结果继续修改。论文的6828条查询中,GPT-5.5和Qwen3.8-Max成功率都低于60%

香港科技大学(广州)、腾讯等
VibeWorlding智能体调用3D工具构建可交互世界
2608.16717 视觉与生成

腾讯优图上交等发布PersonaShot:AI视频画面再漂亮,也会在切镜后忘记人物状态

上海交通大学、腾讯优图实验室和浙江大学联合发布PersonaShot,专门评估人物在多镜头AI视频中的叙事连续性。基准包含约1000个多镜头片段和16项指标。团队发现,高观感画质并不保证切镜后的物理状态、情绪变化和镜头关系保持连贯。

上海交通大学、腾讯优图实验室、浙江大学等
PersonaShot展示AI多镜头视频中的物体、情绪和空间连续性错误
2608.14718 Agent

蚂蚁清华等发布VideoGAIA:GPT-5.5等前沿模型看视频答题仍低于60%

香港中文大学、蚂蚁集团和清华大学等机构联合发布VideoGAIA,把视频问答从“看完选答案”改成多轮调查:模型要反复观察视频、调用外部工具、搜索开放世界信息并整合证据。271项任务中,包括GPT-5.5和Kimi-K3在内的所有受测模型准确

香港中文大学、蚂蚁集团、清华大学等
VideoGAIA比较单轮视频问答与多轮智能体式视频理解
2608.14022 视觉与生成

腾讯港中文等提出ForgeWM:一步生成可玩的游戏世界,回放还能继续精修

扩散世界模型画面越精细,往往要去噪越多步,玩家按键后只能等待;压到一步生成,速度上去了,细节和稳定性又容易下降。腾讯PCG、香港中文大学、复旦大学、上海人工智能实验室、香港科技大学等团队提出ForgeWM,训练1、2、4步不同速度的学生模型

香港中文大学、复旦大学、上海人工智能实验室、香港科技大学等
ForgeWM实时生成Minecraft与射击游戏世界的封面
2608.14530 视觉与生成

游戏世界穿地怎么办?Marionette把规则写进276维3D状态,错误减少66%

视频模型可以生成很像游戏的画面,却常在连续操控后让角色穿地、漂走或动作失真。Alaya Lab、上海创智学院、华中科技大学等团队提出Marionette,不让神经网络同时猜物理状态和像素,而是先生成276维显式3D角色状态,再由零参数几何桥

华中科技大学等
Marionette用3D角色状态生成可控游戏世界的封面
2608.14403 视觉与生成

百度等提出CRAFT:只用1万张参考图训练个性化生成,告别百万合成配对

给AI一张人物、宠物或物品照片,再要求它换姿势、换场景,通常需要大规模合成“参考图—目标图”配对数据。百度、DGIST、KAIST等团队提出CRAFT,只使用1万张彼此独立的参考图训练,不需要预先制作目标合成图,却能同时保持主体身份和文本指

百度、DGIST、KAIST等
CRAFT依据人物宠物和物品参考图生成新场景的封面
2608.13556 视觉与生成

视频生成训练快6倍!牛津NUS提出V-RAE,把视觉大模型表征变成视频潜空间

主流视频生成模型通常先训练一个自编码器,把像素压进潜空间,再让扩散模型从头学习其中的语义。牛津大学与新加坡国立大学提出V-RAE,直接复用冻结视觉基础模型的表征来构建视频潜空间,使生成训练最多加快6倍,并在Kinetics-600上取得19

新加坡国立大学、牛津大学等
V-RAE视频重建与生成效果文章封面
2608.13205 视觉与生成

Adobe上海AI Lab等开源HPSD:让图生视频当老师,把文生视频自己的基本功教强

图生视频有一张高质量首帧做视觉锚点,通常比只靠一句提示词更容易生成稳定画面。Adobe、上海人工智能实验室、上海交通大学、南洋理工大学和复旦大学等团队开源HPSD,让同一个图文生视频模型先以“带首帧老师”提供高质量方向,再让纯文本学生沿自己

上海交通大学、复旦大学、上海人工智能实验室等
HPSD提升文生视频质量的对比文章封面
2608.13552 视觉与生成

快手港中文推出PlayWorld:让AI亲自玩9个世界模型,长时空间一致性仍频频翻车

世界模型生成的视频可能每一帧都很漂亮,但让AI玩家转身、开门、绕一圈再回来,房间结构和物体状态还能对得上吗?快手、香港中文大学、香港大学和浙江大学推出PlayWorld,用Agent玩家在171个交互场景里实测9个世界模型,把评估从“看视频

香港中文大学、香港大学、浙江大学等
PlayWorld让AI玩家测试世界模型的文章封面
2608.13113 大模型

看完一个月生活视频,Gemini仍比人类低22.4分!华为南大推出EgoMonth

一个月前把钥匙放在哪、某次做饭先拿了什么、不同日期见过谁——人会把零散经历串成长期记忆,多模态模型却常在短视频问答里被高估。华为、南京大学和天津大学推出EgoMonth,收集20名参与者跨20至120天的300多小时第一视角视频,用1443

南京大学、天津大学等
EgoMonth跨月第一视角视频记忆基准文章封面
2608.13541 视觉与生成

华为上交开源SCULPT:3D模型像雕塑一样逐块切开,零件还能无缝装回去

一把电钻不是不可编辑的整体,而应该由机身、电池、钻头等零件组成;这些零件单独看要完整,装回去又不能留下裂缝。华为与上海交通大学团队开源SCULPT,像雕塑家从材料上逐次切割一样,从完整3D形状中迭代取出部件,并根据物体复杂度自动决定零件数量

上海交通大学、华为等
SCULPT把完整3D物体拆成可组装部件的文章封面
↑