arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-05 至 2025-08-05 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2508.01546 2025-08-05 cs.CV 88%

E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation

Zeyu Xu, Junkang Zhang, Qiang Wang, Yi Liu

机构 * Zeyu Xu(作者) Junkang Zhang(作者) Qiang Wang(作者) Yi Liu(作者)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02134 2025-08-05 cs.CV 70%

Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference

Kuo Wang, Quanlong Zheng, Junlin Xie, Yanhao Zhang, Jinguo Luo, Haonan Lu, Liang Lin, Fan Zhou, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) OPPO AI Center(OPPO人工智能中心) Research Institute(研究 institute) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Key Laboratory of Digital Living Network and Content Service(深圳数字生活网络与内容服务重点实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments published in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2508.02476 2025-08-05 cs.CR 50%

PoseGuard: Pose-Guided Generation with Safety Guardrails

Kongxin Wang, Jie Zhang, Peigui Qi, Kunsheng Tang, Tianwei Zhang, Wenbo Zhou

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 5 篇

2508.01698 2025-08-05 cs.CV 83%

Versatile Transition Generation with Image-to-Video Diffusion

Zuhao Yang, Jiahui Zhang, Yingchen Yu, Shijian Lu, Song Bai

机构 * Nanyang Technological University(南洋理工大学) ByteDance Inc.(字节跳动公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04847 2025-08-05 cs.CV 79%

HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation

Qijun Gan, Yi Ren, Chen Zhang, Zhenhui Ye, Pan Xie, Xiang Yin, Zehuan Yuan, Bingyue Peng, Jianke Zhu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

Comments https://agnjason.github.io/HumanDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05442 2025-08-05 cs.CV cs.AI eess.IV 73%

Progressive Growing of Video Tokenizers for Temporally Compact Latent Spaces

Aniruddha Mahapatra, Long Mai, David Bourgin, Yitian Zhang, Feng Liu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

Comments Project website: https://progressive-video-tokenizer.github.io/Pro-MAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12049 2025-08-05 cs.CV 57%

TACO: Taming Diffusion for in-the-wild Video Amodal Completion

Ruijie Lu, Yixin Chen, Yu Liu, Jiaxiang Tang, Junfeng Ni, Diwen Wan, Gang Zeng, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) State Key Laboratory of General Artificial Intelligence, BIGAI(BIGAI 通用人工智能国家重点实验室) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025.Project page: https://jason-aplp.github.io/TACO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15580 2025-08-05 cs.CV 57%

TKG-DM: Training-free Chroma Key Content Generation Diffusion Model

Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Takahiro Shirakawa, Ko Watanabe, Andreas Dengel, Jinjia Zhou

机构 * Faculty of Science and Engineering(科学与工程学部) RPTU Kaiserslautern-Landau & DFKI GmbH(科隆-兰道大学与DFKI GmbH)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Accepted to CVPR2025(Highlight). Code at: https://github.com/ryugo417/TKG-DM

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 3 篇

2409.01071 2025-08-05 cs.CV cs.CL 85%

VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges

Yuxuan Wang, Yiqi Song, Cihang Xie, Yang Liu, Zilong Zheng

机构 * NLCo Lab, State Key Laboratory of General Artificial Intelligence, BIGAI(NLCo实验室、国家一般人工智能重点实验室、BIGAI) School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院、北京理工大学) Computer Science and Engineering, University of California(计算机科学与工程系、加州大学) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所、北京大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);video-language(abstract);long video(abstract);分类 cs.CV

Comments To appear at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10857 2025-08-05 cs.CV cs.AI cs.MM 62%

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Jiashuo Yu, Yue Wu, Meng Chu, Zhifei Ren, Zizheng Huang, Pei Chu, Ruijie Zhang, Yinan He, Qirui Li, Songze Li, Zhenxiang Li, Zhongying Tu, Conghui He, Yu Qiao, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09144 2025-08-05 cs.CV 57%

$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting

Zhimin Liao, Ping Wei, Ruijie Zhang, Shuaijia Chen, Haoxuan Wang, Ziyang Ren

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人工智能与机器人学院,西安交通大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏