arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-11 至 2025-12-11 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2512.08979 2025-12-11 cs.CV cs.AI 57%

What Happens When: Learning Temporal Orders of Events in Videos

当什么发生时:学习视频中事件的时间顺序

Daechul Ahn, Yura Choi, Hyeonbeom Choi, Seongwon Cho, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出MECOT方法,通过事件级描述训练和思维链提示提升视频模型对事件时间顺序的理解能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2512.05802 2025-12-11 cs.CV 85%

Bring Your Dreams to Life: Continual Text-to-Video Customization

让梦想成真:持续文本到视频定制

Jiahua Dong, Xudong Wang, Wenqi Liang, Zongyan Han, Meng Cao, Duzhen Zhang, Hanbin Zhao, Zhi Han, Salman Khan, Fahad Shahbaz Khan

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出CCVD模型,通过解决持续学习中的遗忘和概念忽视问题,实现文本到视频的持续定制生成。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04221 2025-12-11 cs.CV 83%

MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis

MoReGen:基于代码领域的文本到视频合成多智能体运动-推理引擎

Xiangyu Bai, He Liang, Bishoy Galoaa, Utsav Nandi, Shayda Moezzi, Yuhang He, Sarah Ostadabbas

机构 * Northeastern University(东北大学) University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 MoReGen通过整合多智能体大语言模型、物理模拟器和渲染器,实现了基于代码领域的文本到视频合成,强调物理精度和运动一致性,为生成符合物理原理的视频提供了一种新的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09864 2025-12-11 cs.CV 57%

UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving

UniUGP:统一理解、生成与规划以实现端到端自动驾驶

Hao Lu, Ziyang Liu, Guangfeng Jiang, Yuanfei Luo, Sheng Chen, Yangang Zhang, Ying-Cong Chen

机构 * ByteDance Seed(字节跳动种子)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 UniUGP通过整合预训练视觉模型和视频生成模型,实现端到端自动驾驶中的场景推理、视频生成和轨迹规划,提升复杂场景下的性能和泛化能力。

Comments Project Page: https://seed-uniugp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09995 2025-12-11 cs.CV 57%

PlayerOne: Egocentric World Simulator

PlayerOne:第一人称真实世界模拟器

Yuanpeng Tu, Hao Luo, Xi Chen, Xiang Bai, Fan Wang, Hengshuang Zhao

机构 * HKU(香港大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(华盘实验室) HUST(华中科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PlayerOne通过第一人称真实世界模拟器实现了沉浸式探索,通过粗到细的训练流程和部分解耦运动注入方案,实现了对人类运动的精确控制和多样化场景的一致建模。

Comments Project page: https://playerone-hku.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2512.09418 2025-12-11 cs.CV 57%

Label-free Motion-Conditioned Diffusion Model for Cardiac Ultrasound Synthesis

无标签的运动条件化扩散模型用于心脏超声合成

Zhe Li, Hadrien Reynaud, Johanna P Müller, Bernhard Kainz

机构 * Department AIBE, FAU Erlangen-Nürnberg(AIBE部门,埃尔朗根-纽伦堡大学) Department of Computing, Imperial College London(计算系,伦敦帝国理工学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出无标签的运动条件化扩散模型,通过自监督运动特征生成逼真的心脏超声视频,无需手动标注。

Comments Accepted at MICAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09417 2025-12-11 cs.CV 57%

DirectSwap: Mask-Free Cross-Identity Training and Benchmarking for Expression-Consistent Video Head Swapping

DirectSwap: 无掩码跨身份训练与基准测试用于表情一致的视频头部交换

Yanan Wang, Shengcai Liao, Panwen Hu, Xin Li, Fan Yang, Xiaodan Liang

机构 * MBZUAI(马克斯·普朗克智能研究院) UAEU(阿拉伯联合酋长国大学) AIQ(人工智能量子研究所) SYSU(南方大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DirectSwap通过无掩码直接视频头部交换框架,结合运动和表情感知重建损失,实现了跨身份视频头部交换的高质量和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09406 2025-12-11 cs.RO cs.AI cs.CV 57%

H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos

H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式

Hai Ci, Xiaokang Liu, Pei Yang, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 3 篇

2512.09354 2025-12-11 cs.CV 79%

Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding

Video-QTR: 一种基于查询的轻量级视频理解时序推理框架

Xinkui Zhao, Zuxin Wang, Yifan Zhang, Guanjie Cheng, Yueshen Xu, Shuiguang Deng, Chang Liu, Naibo Wang, Jianwei Yin

机构 * School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院) School of Computer Science, Zhejiang University, Hangzhou, China(浙江大学计算机科学学院) School of Software Engineering, Xidian University, Xi’an, China(西安电子科技大学软件工程学院)

专题命中 长视频与时序推理 :video understanding(title,abstract);分类 cs.CV

AI总结 Video-QTR通过查询驱动的时序推理框架,实现轻量级视频理解,显著降低计算成本并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09841 2025-12-11 cs.CL cs.CV cs.MM 62%

ChronusOmni: Improving Time Awareness of Omni Large Language Models

ChronusOmni: 提升 Omni 大语言模型的时间感知能力

Yijing Chen, Yihan Wu, Kaisi Guan, Yuchen Ren, Yuyue Wang, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) Baichuan Inc.(百川科技公司)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM

AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。

Comments Code available at https://github.com/YJCX330/Chronus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01826 2025-12-11 cs.CV 57%

RELOCATE: A Simple Training-Free Baseline for Visual Query Localization Using Region-Based Representations

RELOCATE:一种用于基于区域的视觉查询定位的简单无训练基线

Savya Khosla, Sethuraman T, Alexander Schwing, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 RELOCATE通过基于区域的表示和双向跟踪实现长视频中视觉查询定位,无需训练并在Ego4D数据集上取得49%的精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 57%

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏