2512.08979 2025-12-11 cs.CV cs.AI 57% What Happens When: Learning Temporal Orders of Events in Videos 当什么发生时:学习视频中事件的时间顺序 Daechul Ahn, Yura Choi, Hyeonbeom Choi, Seongwon Cho, San Kim, Jonghyun Choi 机构 * Seoul National University(首尔国立大学) ; Imperial College London(帝国理工学院伦敦分校) 纠错 专题命中 视频理解 :video understanding(abstract);分类 cs.CV AI总结 本文提出MECOT方法,通过事件级描述训练和思维链提示提升视频模型对事件时间顺序的理解能力。 Comments WACV 2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.05802 2025-12-11 cs.CV 85% Bring Your Dreams to Life: Continual Text-to-Video Customization 让梦想成真:持续文本到视频定制 Jiahua Dong, Xudong Wang, Wenqi Liang, Zongyan Han, Meng Cao, Duzhen Zhang, Hanbin Zhao, Zhi Han, Salman Khan, Fahad Shahbaz Khan 专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV AI总结 本文提出CCVD模型,通过解决持续学习中的遗忘和概念忽视问题,实现文本到视频的持续定制生成。 Comments Accepted to AAAI2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.04221 2025-12-11 cs.CV 83% MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis MoReGen:基于代码领域的文本到视频合成多智能体运动-推理引擎 Xiangyu Bai, He Liang, Bishoy Galoaa, Utsav Nandi, Shayda Moezzi, Yuhang He, Sarah Ostadabbas 机构 * Northeastern University(东北大学) ; University of Oxford(牛津大学) ; Microsoft Research(微软研究院) 纠错 专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV AI总结 MoReGen通过整合多智能体大语言模型、物理模拟器和渲染器,实现了基于代码领域的文本到视频合成,强调物理精度和运动一致性,为生成符合物理原理的视频提供了一种新的方法。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.09864 2025-12-11 cs.CV 57% UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving UniUGP:统一理解、生成与规划以实现端到端自动驾驶 Hao Lu, Ziyang Liu, Guangfeng Jiang, Yuanfei Luo, Sheng Chen, Yangang Zhang, Ying-Cong Chen 机构 * ByteDance Seed(字节跳动种子) 纠错 专题命中 视频生成 :video generation(abstract);分类 cs.CV AI总结 UniUGP通过整合预训练视觉模型和视频生成模型,实现端到端自动驾驶中的场景推理、视频生成和轨迹规划,提升复杂场景下的性能和泛化能力。 Comments Project Page: https://seed-uniugp.github.io/ 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2506.09995 2025-12-11 cs.CV 57% PlayerOne: Egocentric World Simulator PlayerOne:第一人称真实世界模拟器 Yuanpeng Tu, Hao Luo, Xi Chen, Xiang Bai, Fan Wang, Hengshuang Zhao 机构 * HKU(香港大学) ; DAMO Academy, Alibaba Group(阿里云达摩院) ; Hupan Lab(华盘实验室) ; HUST(华中科技大学) 纠错 专题命中 视频生成 :video generation(abstract);分类 cs.CV AI总结 PlayerOne通过第一人称真实世界模拟器实现了沉浸式探索,通过粗到细的训练流程和部分解耦运动注入方案,实现了对人类运动的精确控制和多样化场景的一致建模。 Comments Project page: https://playerone-hku.github.io/ 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.09418 2025-12-11 cs.CV 57% Label-free Motion-Conditioned Diffusion Model for Cardiac Ultrasound Synthesis 无标签的运动条件化扩散模型用于心脏超声合成 Zhe Li, Hadrien Reynaud, Johanna P Müller, Bernhard Kainz 机构 * Department AIBE, FAU Erlangen-Nürnberg(AIBE部门,埃尔朗根-纽伦堡大学) ; Department of Computing, Imperial College London(计算系,伦敦帝国理工学院) 纠错 专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV AI总结 本文提出无标签的运动条件化扩散模型,通过自监督运动特征生成逼真的心脏超声视频,无需手动标注。 Comments Accepted at MICAD 2025 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.09417 2025-12-11 cs.CV 57% DirectSwap: Mask-Free Cross-Identity Training and Benchmarking for Expression-Consistent Video Head Swapping DirectSwap: 无掩码跨身份训练与基准测试用于表情一致的视频头部交换 Yanan Wang, Shengcai Liao, Panwen Hu, Xin Li, Fan Yang, Xiaodan Liang 机构 * MBZUAI(马克斯·普朗克智能研究院) ; UAEU(阿拉伯联合酋长国大学) ; AIQ(人工智能量子研究所) ; SYSU(南方大学) 纠错 专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV AI总结 DirectSwap通过无掩码直接视频头部交换框架,结合运动和表情感知重建损失,实现了跨身份视频头部交换的高质量和一致性。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.09406 2025-12-11 cs.RO cs.AI cs.CV 57% H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式 Hai Ci, Xiaokang Liu, Pei Yang, Yiren Song, Mike Zheng Shou 机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室) 纠错 专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。 Comments 13 pages, 6 figures 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.09354 2025-12-11 cs.CV 79% Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding Video-QTR: 一种基于查询的轻量级视频理解时序推理框架 Xinkui Zhao, Zuxin Wang, Yifan Zhang, Guanjie Cheng, Yueshen Xu, Shuiguang Deng, Chang Liu, Naibo Wang, Jianwei Yin 机构 * School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院) ; School of Computer Science, Zhejiang University, Hangzhou, China(浙江大学计算机科学学院) ; School of Software Engineering, Xidian University, Xi’an, China(西安电子科技大学软件工程学院) 纠错 专题命中 长视频与时序推理 :video understanding(title,abstract);分类 cs.CV AI总结 Video-QTR通过查询驱动的时序推理框架,实现轻量级视频理解,显著降低计算成本并提升效率。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.09841 2025-12-11 cs.CL cs.CV cs.MM 62% ChronusOmni: Improving Time Awareness of Omni Large Language Models ChronusOmni: 提升 Omni 大语言模型的时间感知能力 Yijing Chen, Yihan Wu, Kaisi Guan, Yuchen Ren, Yuyue Wang, Ruihua Song, Liyun Ru 机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) ; Baichuan Inc.(百川科技公司) 纠错 专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。 Comments Code available at https://github.com/YJCX330/Chronus/ 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2412.01826 2025-12-11 cs.CV 57% RELOCATE: A Simple Training-Free Baseline for Visual Query Localization Using Region-Based Representations RELOCATE:一种用于基于区域的视觉查询定位的简单无训练基线 Savya Khosla, Sethuraman T, Alexander Schwing, Derek Hoiem 机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) 纠错 专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV AI总结 RELOCATE通过基于区域的表示和双向跟踪实现长视频中视觉查询定位,无需训练并在Ego4D数据集上取得49%的精度提升。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 57% Rethinking Chain-of-Thought Reasoning for Videos 重新思考视频中的链式推理 Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang 机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) 纠错 专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。 Comments Technical report 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图