arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-18 至 2025-11-18 共收录 26 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2511.13054 2025-11-18 cs.CV 84%

ViSS-R1: Self-Supervised Reinforcement Video Reasoning

Bo Fang, Yuxin Song, Qiangqiang Wu, Haoyuan Sun, Wenhao Wu, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司) Tsinghua University(清华大学) The University of Sydney(悉尼大学)

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

Comments Our paper was initially titled "Video-SSR1: Self-Supervised Reinforcement Video Reasoning." Upon noticing its close resemblance to the title of a recently released paper, we have decided to rename our work as "ViSS-R1."

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13644 2025-11-18 cs.CV 79%

CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding

Shrenik Patel, Daivik Patel

机构 * Rutgers University(罗切斯特大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12530 2025-11-18 cs.CV 79%

ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding

Yuan Zhou, Litao Hua, Shilong Jin, Wentao Huang, Haoran Duan

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted to AAAI 2026. Code is available at: https://github.com/robin-hlt/AAAI26-ReaSon

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23447 2025-11-18 cs.CV 57%

CA^2ST: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition

Jongseo Lee, Joohyun Chang, Dongho Lee, Jinwoo Choi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Our paper has been accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2511.12371 2025-11-18 cs.CV 79%

Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models

Yiqing Shen, Chenxiao Fan, Chenjia Li, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15607 2025-11-18 cs.RO 50%

GRIM: Task-Oriented Grasping with Conditioning on Generative Examples

Shailesh, Alok Raj, Nayan Kumar, Priya Shukla, Andrew Melnik, Michael Beetz, Gora Chand Nandi

专题命中 视频生成 :video generation(abstract)

Comments Accepted to AAAI-26 (Oral). Project website: https://grim-tog.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16587 2025-11-18 cs.RO 50%

Human2Robot: Learning Robot Actions from Paired Human-Robot Videos

Sicheng Xie, Haidong Cao, Zejia Weng, Zhen Xing, Haoran Chen, Shiwei Shen, Jiaqi Leng, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 12 篇

2504.10825 2025-11-18 cs.CV 85%

OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding

Dianbing Xi, Jiepeng Wang, Yuanzhi Liang, Xi Qiu, Yuchi Huo, Rui Wang, Chi Zhang, Xuelong Li

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);video understanding(abstract);分类 cs.CV

Comments Accepted by AAAI 2026. Our project page: https://tele-ai.github.io/OmniVDiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12099 2025-11-18 cs.CV 85%

Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models

Tianle Cheng, Zeyan Zhang, Kaifeng Gao, Jun Xiao

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24899 2025-11-18 cs.CV 83%

Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer

Mohsen Ghafoorian, Denis Korzhenkov, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00652 2025-11-18 cs.CV cs.CR 83%

Video Signature: Implicit Watermarking for Video Diffusion Models

Yu Huang, Junhao Chen, Shuliang Liu, Hanqian Li, Jungang Li, Qi Zheng, Aiwei Liu, Yi R. Fung, Xuming Hu

机构 * AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能 thrust) Hong Kong University of Science and Technology(香港科学与技术大学) School of Software, BNRist, Tsinghua University(清华大学软件学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16359 2025-11-18 cs.CR 82%

VideoMark: A Distortion-Free Robust Watermarking Framework for Video Diffusion Models

Xuming Hu, Hanqian Li, Jungang Li, Yu Huang, Shuliang Liu, Qi Zheng, Junhao Chen, Aiwei Liu

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12072 2025-11-18 cs.MM cs.AI cs.SD 79%

ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation

Jiahui Sun, Weining Wang, Mingzhen Sun, Yirong Yang, Xinxin Zhu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12056 2025-11-18 cs.CV cs.AI cs.DC 79%

PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling

Sijie Wang, Qiang Wang, Shaohuai Shi

机构 * Sijie Wang, Qiang Wang, Shaohuai Shi(作者)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12241 2025-11-18 cs.AI cs.CV 70%

AURA: Development and Validation of an Augmented Unplanned Removal Alert System using Synthetic ICU Videos

Junhyuk Seo, Hyeyoon Moon, Kyu-Hwan Jung, Namkee Oh, Taerim Kim

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13121 2025-11-18 cs.CV 57%

CloseUpShot: Close-up Novel View Synthesis from Sparse-views via Point-conditioned Diffusion Model

Yuqi Zhang, Guanying Chen, Jiaxing Chen, Chuanyu Fu, Chuan Huang, Shuguang Cui

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院(FNii-深圳)) Chinese University of Hong Kong at Shenzhen (CUHKSZ)(香港中文大学(深圳)) Sun Yat-sen University(中山大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Link: https://zyqz97.github.io/CloseUpShot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03457 2025-11-18 cs.GR cs.CV cs.SD eess.AS 57%

READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation

Haotian Wang, Yuzhe Weng, Jun Du, Haoran Xu, Xiaoyan Wu, Shan He, Bing Yin, Cong Liu, Jianqing Gao, Qingfeng Liu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://readportrait.github.io/READ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01895 2025-11-18 cs.RO cs.CV cs.LG 57%

EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation

Siyuan Huang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Zhengkai Jiang, Yue Hu, Yue Liao, Peng Gao, Hongsheng Li, Maoqing Yao, Guanghui Ren

机构 * SJTU(上海交通大学) AgiBot Shanghai AI Lab(上海人工智能实验室) CUHK MMLab(香港大学多模态实验室) LV-NUS Lab(南洋理工大学-立陶宛实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. Website: https://sites.google.com/view/enerverse

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15979 2025-11-18 cs.GR cs.AI 50%

Dream, Lift, Animate: From Single Images to Animatable Gaussian Avatars

Marcel C. Bühler, Ye Yuan, Xueting Li, Yangyi Huang, Koki Nagano, Umar Iqbal

机构 * ETH Zurich(苏黎世联邦理工学院) NVIDIA(英伟达) Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video diffusion(abstract)

Comments Accepted to 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 2 篇

2508.11576 2025-11-18 cs.CV 79%

Causality Matters: How Temporal Information Emerges in Video Language Models

Yumeng Shi, Quanyu Long, Yin Wu, Wenya Wang

专题命中 动作与事件理解 :video language model(title,abstract);分类 cs.CV

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13315 2025-11-18 cs.CV cs.AI 57%

Computer Vision based group activity detection and action spotting

Narthana Sivalingam, Santhirarajah Sivasthigan, Thamayanthi Mahendranathan, G. M. R. I. Godaliyadda, M. P. B. Ekanayake, H. M. V. R. Herath

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 3 篇

2506.04953 2025-11-18 cs.CV 88%

APVR: Hour-Level Long Video Understanding with Adaptive Pivot Visual Information Retrieval

Hong Gao, Yiming Bao, Xuezhen Tu, Bin Zhong, Linan Yue, Minling Zhang

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12027 2025-11-18 cs.CV cs.AI 83%

GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory

Jeong Hun Yeo, Sangyun Chung, Sungjune Park, Dae Hoe Kim, Jinyoung Moon, Yong Man Ro

机构 * Integrated Vision and Language Lab., School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(整合视觉与语言实验室,电气工程学院,韩国科学技术院(KAIST)) Visual Intelligence Research Section, Superintelligence Creative Research Laboratory, Electronics and Telecommunications Research Institute (ETRI)(视觉智能研究部,超智能创意研究实验室,电子电信研究院)

专题命中 长视频与时序推理 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09057 2025-11-18 cs.CV cs.AI cs.CL cs.LG 70%

PAN: A World Model for General, Interactable, and Long-Horizon World Simulation

PAN Team, Jiannan Xiang, Yi Gu, Zihan Liu, Zeyu Feng, Qiyue Gao, Yiyan Hu, Benhao Huang, Guangyi Liu, Yichi Yang, Kun Zhou, Davit Abrahamyan, Arif Ahmad, Ganesh Bannur, Junrong Chen, Kimi Chen, Mingkai Deng, Ruobing Han, Xinqi Huang, Haoqiang Kang, Zheqi Liu, Enze Ma, Hector Ren, Yashowardhan Shinde, Rohan Shingre, Ramsundar Tanikella, Kaiming Tao, Dequan Yang, Xinle Yu, Cong Zeng, Binglin Zhou, Zhengzhong Liu, Zhiting Hu, Eric P. Xing

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 2 篇

2502.10810 2025-11-18 cs.CV 79%

SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding

Zhenyu Yang, Yuhang Hu, Zemin Du, Dizhan Xue, Shengsheng Qian, Jiahong Wu, Fan Yang, Weiming Dong, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技) Zhengzhou University(郑州大学) ShanghaiTech University(上海科技大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments ICLR 2025 Accepted (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13297 2025-11-18 cs.CV 57%

CorrectAD: A Self-Correcting Agentic System to Improve End-to-end Planning in Autonomous Driving

Enhui Ma, Lijun Zhou, Tao Tang, Jiahuan Zhang, Junpeng Jiang, Zhan Zhang, Dong Han, Kun Zhan, Xueyang Zhang, XianPeng Lang, Haiyang Sun, Xia Zhou, Di Lin, Kaicheng Yu

机构 * Li Auto Inc. Autolab, Westlake University(Autolab,西lake大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏