arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-10-01 至 2025-10-01 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2507.04909 2025-10-01 cs.CV cs.AI 83%

HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding

Yuxuan Cai, Jiangning Zhang, Zhenye Gan, Qingdong He, Xiaobin Hu, Junwei Zhu, Yabiao Wang, Chengjie Wang, Zhucun Xue, Chaoyou Fu, Xinwei He, Xiang Bai

机构 * Fantasyele

专题命中 视频理解 :video understanding(title,abstract);video generation(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24200 2025-10-01 cs.CV 57%

UniVid: The Open-Source Unified Video Model

Jiabin Luo, Junhui Lin, Zeyu Zhang, Biao Wu, Meng Fang, Ling Chen, Hao Tang

机构 * Peking University(北京大学) AI Geeks Australian Artificial Intelligence Institute(澳大利亚人工智能研究所)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2509.26391 2025-10-01 cs.CV 83%

MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation

Chenhui Zhu, Yilu Wu, Shuai Wang, Gangshan Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2509.26025 2025-10-01 cs.CV 83%

PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution

Shian Du, Menghan Xia, Chang Liu, Xintao Wang, Jing Wang, Pengfei Wan, Di Zhang, Xiangyang Ji

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Beijing Institute of Technology(北京理工大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13343 2025-10-01 cs.CV eess.IV 81%

Taming Diffusion Transformer for Efficient Mobile Video Generation in Seconds

Yushu Wu, Yanyu Li, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ke Ma, Arpit Sahni, Ju Hu, Aliaksandr Siarohin, Dhritiman Sagar, Yanzhi Wang, Sergey Tulyakov

机构 * Snap Inc.(Snap公司) Northeastern University(东北大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 21 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2509.24304 2025-10-01 cs.CV 85%

FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting

Zefeng He, Xiaoye Qu, Yafu Li, Siyuan Huang, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07966 2025-10-01 cs.CV cs.AI cs.CL 85%

Scaling RL to Long Videos

Yukang Chen, Wei Huang, Baifeng Shi, Qinghao Hu, Hanrong Ye, Ligeng Zhu, Zhijian Liu, Pavlo Molchanov, Jan Kautz, Xiaojuan Qi, Sifei Liu, Hongxu Yin, Yao Lu, Song Han

机构 * NVIDIA MIT(麻省理工学院) HKU(香港大学) UC Berkeley(加州大学伯克利分校)

专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);video reasoning(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 3 篇

2509.26555 2025-10-01 cs.CV 79%

Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation

Agneet Chatterjee, Rahim Entezari, Maksym Zhuravinskyi, Maksim Lapin, Reshinth Adithyan, Amit Raj, Chitta Baral, Yezhou Yang, Varun Jampani

机构 * Stability AI Arizona State University(亚利桑那州立大学) Google DeepMind(谷歌DeepMind)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments NeurIPS 2025. Project Page : https://stable-cinemetrics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07032 2025-10-01 cs.CL cs.CV 57%

A Culturally-diverse Multilingual Multimodal Video Benchmark & Model

Bhuiyan Sanjid Shafique, Ashmal Vayani, Muhammad Maaz, Hanoona Abdul Rasheed, Dinura Dissanayake, Mohammed Irfan Kurpath, Yahya Hmaiti, Go Inoue, Jean Lahoud, Md. Safirur Rashid, Shadid Intisar Quasem, Maheen Fatima, Franco Vidal, Mykola Maslych, Ketan Pravin More, Sanoojan Baliah, Hasindri Watawana, Yuhao Li, Fabian Farestam, Leon Schaller, Roman Tymtsiv, Simon Weber, Hisham Cholakkal, Ivan Laptev, Shin'ichi Satoh, Michael Felsberg, Mubarak Shah, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫德赫·本·扎耶德人工智能大学) University of Central Florida(中央佛罗里达大学) Islamic University of Technology(伊斯兰技术大学) Air University(空军大学) ETH Zurich(苏黎世联邦理工学院) Technische Universität München(慕尼黑技术大学) National Institute of Informatics(国家信息研究所) Australian National University(澳大利亚国立大学) Linköping University(利尔贝里大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00613 2025-10-01 cs.RO cs.AI 50%

WorldGym: World Model as An Environment for Policy Evaluation

Julian Quevedo, Ansh Kumar Sharma, Yixiang Sun, Varad Suryavanshi, Percy Liang, Sherry Yang

机构 * Stanford University(斯坦福大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind)

专题命中 视频数据与评测 :video generation(abstract)

Comments https://world-model-eval.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏