清华&长城汽车等提出SPVC:修好跨数据集驾驶视频里的结构错位
自动驾驶仿真把相机移到训练轨迹之外,3D高斯溅射生成的道路、建筑和车道线容易变形;向场景插入车辆后,前景还可能与背景错位。清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等机构提出SPVC,用一套两阶段视频扩散模型修复跨数据集驾
自动驾驶仿真把相机移到训练轨迹之外,3D高斯溅射生成的道路、建筑和车道线容易变形;向场景插入车辆后,前景还可能与背景错位。清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等机构提出SPVC,用一套两阶段视频扩散模型修复跨数据集驾
把人物外套换色、在肩膀上加一只鹦鹉,再替换背景,现有视频编辑数据通常会把三项操作拆成三个样本。腾讯发布CoinVE-200K,把2至5种原子编辑组合进同一条指令,目标同时覆盖人物、物体和背景。
扩散模型从低分辨率切到高分辨率时,通常会把所有潜在Token一起放大,即使大片背景已经稳定。上海交通大学、山东大学、阿里云、西安交通大学等机构提出AViTS,依据文本相关性和跨去噪步骤的特征变化,只优先细化真正重要的Token。
机器人换一副机械臂,原有世界模型往往就要重新学习动作含义。英伟达、布朗大学、哥伦比亚大学、哈佛大学等机构提出Hydra-0,把关节角、末端位姿等机器人专属命令转换成画面中的像素运动轨迹,让不同形态的机器人共享一种视觉动作接口。
剑桥大学团队提出RigidBench,用模拟器给视频生成模型建立可核对的刚体运动标准答案。8款模型在同一批100个样本上接受10项测量,没有一个模型在全部指标领先;更反常的是,模型平均SSIM越高,3D轨迹误差反而越大,相关系数达到0.89
上海人工智能实验室、复旦大学和中国科学技术大学等机构联合提出MegaParts,用自回归大模型生成由语义零件组成的3D物体。系统支持最多300个部件、最长25.6万Token序列,生成的门、抽屉、钢琴键等部件保持独立,便于后续移动、替换和制
香港科技大学(广州)和腾讯联合提出VibeWorlding:用户用文字或图片描述场景,智能体自行理解意图、检索3D资产、调整布局,并根据多视角渲染结果继续修改。论文的6828条查询中,GPT-5.5和Qwen3.8-Max成功率都低于60%
上海交通大学、腾讯优图实验室和浙江大学联合发布PersonaShot,专门评估人物在多镜头AI视频中的叙事连续性。基准包含约1000个多镜头片段和16项指标。团队发现,高观感画质并不保证切镜后的物理状态、情绪变化和镜头关系保持连贯。
香港中文大学、蚂蚁集团和清华大学等机构联合发布VideoGAIA,把视频问答从“看完选答案”改成多轮调查:模型要反复观察视频、调用外部工具、搜索开放世界信息并整合证据。271项任务中,包括GPT-5.5和Kimi-K3在内的所有受测模型准确
扩散世界模型画面越精细,往往要去噪越多步,玩家按键后只能等待;压到一步生成,速度上去了,细节和稳定性又容易下降。腾讯PCG、香港中文大学、复旦大学、上海人工智能实验室、香港科技大学等团队提出ForgeWM,训练1、2、4步不同速度的学生模型
视频模型可以生成很像游戏的画面,却常在连续操控后让角色穿地、漂走或动作失真。Alaya Lab、上海创智学院、华中科技大学等团队提出Marionette,不让神经网络同时猜物理状态和像素,而是先生成276维显式3D角色状态,再由零参数几何桥
捷克理工大学视觉识别团队提出ReImageNet,重新检查ImageNet-1k的5万张验证图,发现约12%的原标签错误,33.3%的图片天然包含多个类别,还有3.8%根本找不到合适的ImageNet类别。换用新标签后,多模态大模型准确率普
给AI一张人物、宠物或物品照片,再要求它换姿势、换场景,通常需要大规模合成“参考图—目标图”配对数据。百度、DGIST、KAIST等团队提出CRAFT,只使用1万张彼此独立的参考图训练,不需要预先制作目标合成图,却能同时保持主体身份和文本指
香港科技大学iComAI Lab与Vivix Group团队提出Omni-LiveAvatar,把联合音视频扩散模型改造成少步自回归生成器,在单张NVIDIA H200上完成分钟级流式生成,速度达到21.99 FPS,相比LTX-2快33倍
人拿起杯子可能是自己喝,也可能准备递给机器人。若等物体已经伸到面前才判断,机械臂反应会显得迟钝;过早误判又可能突然伸手。阿里巴巴、浙江大学等团队提出PassGen,先生成未来的RGB-D递物视频来判断意图,并利用Hand2Bot真实数据中的
主流视频生成模型通常先训练一个自编码器,把像素压进潜空间,再让扩散模型从头学习其中的语义。牛津大学与新加坡国立大学提出V-RAE,直接复用冻结视觉基础模型的表征来构建视频潜空间,使生成训练最多加快6倍,并在Kinetics-600上取得19
图生视频有一张高质量首帧做视觉锚点,通常比只靠一句提示词更容易生成稳定画面。Adobe、上海人工智能实验室、上海交通大学、南洋理工大学和复旦大学等团队开源HPSD,让同一个图文生视频模型先以“带首帧老师”提供高质量方向,再让纯文本学生沿自己
世界模型生成的视频可能每一帧都很漂亮,但让AI玩家转身、开门、绕一圈再回来,房间结构和物体状态还能对得上吗?快手、香港中文大学、香港大学和浙江大学推出PlayWorld,用Agent玩家在171个交互场景里实测9个世界模型,把评估从“看视频
一个月前把钥匙放在哪、某次做饭先拿了什么、不同日期见过谁——人会把零散经历串成长期记忆,多模态模型却常在短视频问答里被高估。华为、南京大学和天津大学推出EgoMonth,收集20名参与者跨20至120天的300多小时第一视角视频,用1443
一把电钻不是不可编辑的整体,而应该由机身、电池、钻头等零件组成;这些零件单独看要完整,装回去又不能留下裂缝。华为与上海交通大学团队开源SCULPT,像雕塑家从材料上逐次切割一样,从完整3D形状中迭代取出部件,并根据物体复杂度自动决定零件数量