腾讯&北大等把视频变3D动作,仿真追踪成功率升至82.47%
腾讯、北京大学、香港科技大学等机构提出FlowHMR,从普通单目视频恢复三维人体动作,再通过物理控制器检查动作能否被稳定追踪。在4182段网络视频评测中,仿真追踪成功率达到82.47%,GVHMR对照为62.82%。恢复出来的动作兼顾视频中
腾讯、北京大学、香港科技大学等机构提出FlowHMR,从普通单目视频恢复三维人体动作,再通过物理控制器检查动作能否被稳定追踪。在4182段网络视频评测中,仿真追踪成功率达到82.47%,GVHMR对照为62.82%。恢复出来的动作兼顾视频中
Adobe研究院、捷克理工大学等机构提出MemComposer,让AI记住拍摄素材,再按文字要求生成补充镜头。对比无素材参考方案,用户更偏好它与原片的视觉对齐。系统先规划镜头、检索人物和场景,再生成原片没有的画面,沿用影片的视觉信息。
滑铁卢大学、英伟达、台湾大学和南洋理工大学等机构提出VIEScore2图片评分与缺陷定位模型。它指出异常所在格子,并区分画面瑕疵和指令不一致。总体评分比比较的通用模型更贴近人工排序,为人工返修提供具体位置。
上海交通大学、华为等机构提出CPIC,让裁图AI跳出固定网格,允许同一照片存在多种好构图。模型在二百张测试图上给出一百九十九种裁框。团队把人类偏好、主体保留和构图规则一起用于训练,让裁框可以在好构图附近灵活调整。
华中科技大学、北京交通大学与地平线提出Multimodal Flow,把文字和图像都放进连续空间,用同一套流匹配目标训练理解与生成。模型可处理图文问答、描述和图像生成;论文以5幅图、10张表报告实验,但“统一”指训练机制,不意味着所有任务都
以色列理工学院、康奈尔科技校区与NVIDIA提出DyRAD,从录制的车载雷达数据重建可换轨迹、换传感器配置的动态场景。它显式建模径向速度与传感器响应,在离轨视角的物体恢复率上从对照的26.9%提升到90.7%;结果来自论文数据集与指标。
韩国科学技术院、苏黎世联邦理工学院、Google、慕尼黑工业大学等机构提出Imagine3D-LLM,让多模态大模型回答前先把多视角照片压成紧凑三维场景。它在多项空间推理和3D理解基准上持续超过既有方法,证明粗略“脑补”场景比只对齐像素更有
英伟达团队提出SoL-Refiner,把低分辨率视频升级到4K所需的扩散精修压缩为一次去噪。它在约2K设置中同时领先多种外部精修器,并凭完整加速栈把相对三步基线的精修延迟缩短到原来的约九分之一。
哈佛大学、新加坡国立大学、麻省理工学院、MIT-IBM Watson AI Lab等机构提出Honeycomb,用六张固定尺寸的空间与时空平面保存长视频场景。实验表明它在记忆占用不随生成时长增长的同时,仍能在WorldScore与RealE
亚马逊FAR、加州大学伯克利分校、卡内基梅隆大学、斯坦福大学等机构提出PRISM,把少量真人示范扩成数百段反事实视频,再转成可训练的人形机器人轨迹。策略不做真实世界微调,也能让机器人拾取、搬运并放下未见过的箱子、桶、筐和球。
香港科技大学(广州)、粤港澳大湾区数字经济研究院、香港科技大学等机构提出SatNav,用卫星影像构建城市级无人机语言导航测试。系统从18座城市的59个场景生成约11.8万条任务轨迹,平均路径长379米,让模型学习沿道路、水道和地标完成较长距
清华大学、京东、东南大学等机构提出Routed Forcing,想解决实时数字人常见的“嘴在动,身体却像木头”的问题。团队发现,压缩视频生成模型时,动作丰富度主要在人物身体区域流失,于是只在需要的位置和训练阶段加入真实视频示范。在两套实验数
上海交通大学、清华大学、上海人工智能实验室、北京邮电大学等机构提出ManiVid,让视频取证从“判断真假”进一步走向“标出哪里被改、说明为什么可疑”。研究团队构建约3.8万段带标注的篡改视频,并在专门测试中提升篡改区域定位和异常解释成绩。面
韩国技术教育大学提出DAWN,把对噪声的抵抗力直接做进世界模型:喂给编码器的是带噪深度,重建目标却是干净深度,再用对比学习对齐两者。在Unitree Go1上,它不做任何手工滤波校准,零样本跨过70厘米缝隙、登上45厘米台阶。传感器再脏,机
上海人工智能实验室联合香港理工大学、新加坡国立大学、浙江大学提出AV-GRPO,用强化学习同时调教视频的画面和声音。在JavisBench与VABench上,它在生成质量、语义对齐和跨模态同步上全面超过LTX-2.3。AI生成的视频终于不再
阿里巴巴万相团队联合南京大学、复旦大学、清华大学做出一个397B参数的提示增强模型WanPE。它把用户的简单一句话扩写成导演级分镜计划再驱动视频生成,30秒视频的人类好评率相对原始提示暴涨50.86个点。长视频终于不再靠写提示碰运气。
哈尔滨工业大学、阿里巴巴集团淘宝提出ZoomDiff,专门处理双摄设备在广角和长焦镜头之间切换时的几何跳变、颜色偏移和细节模糊。方法在潜空间和像素空间同时使用两个镜头的画面,在合成与真实数据集上都报告了定量和定性优势。
巴塞罗那超级计算中心、加泰罗尼亚理工大学系统测试了13种混合精度量化敏感度指标。梯度方法在8个模型-硬件配置中4个发生灾难性失败,Jensen-Shannon散度则为零;再配合K-Means分组,方案在近乎无精度损失下平均加速1.81倍。
Noetix Robotics、清华大学提出DAVIS,让人形机器人仅根据头戴深度图、本体历史和任务指令,直接输出25自由度关节目标。系统在仿真与Noetix E1真机上展示了定向射门和盘带,运行时不需要额外的视觉检测或路径规划模块。
香港科技大学、腾讯与香港大学等机构联合推出几何原生自编码器GAE,攻克了世界模型在长程三维漫游中容易变形穿模的结构缺陷。研究团队将几何基础模型的多层级表征融入视频潜在空间,从底层赋予生成模型强三维几何先验。在权威真实室内与室外漫游评测中,G