arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-12 至 2025-08-12 共收录 20 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2412.00624 2025-08-12 cs.CV 85%

VideoSAVi: Self-Aligned Video Language Models without Human Supervision

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01422 2025-08-12 cs.CV 79%

DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes

Zhende Song, Chenchen Wang, Jiamu Sheng, Chi Zhang, Shengji Tang, Jiayuan Fan, Tao Chen

机构 * Fudan University(复旦大学) Westlake University, Tencent PCG(西湖大学、腾讯PCG)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted by ACMM'MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09919 2025-08-12 cs.CV cs.AI 70%

B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens

Zhuqiang Lu, Zhenfei Yin, Mengwei He, Zhihui Wang, Zicheng Liu, Zhiyong Wang, Kun Hu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) International School of Information Science and Engineering, Dalian University of Technology(大连理工大学信息科学与工程国际学院) Advanced Micro Devices(先进微器件公司) School of Science, Edith Cowan University(埃迪斯科文大学科学学院)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by ICCV2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23870 2025-08-12 cs.LG cs.AI 50%

MaCP: Minimal yet Mighty Adaptation via Hierarchical Cosine Projection

Yixian Shen, Qi Bi, Jia-Hong Huang, Hongyi Zhu, Andy D. Pimentel, Anuj Pathania

专题命中 视频理解 :video understanding(abstract)

Comments This work was intended as a replacement of arXiv:2410.09103 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09103 2025-08-12 cs.LG cs.AI 50%

MaCP: Minimal yet Mighty Adaptation via Hierarchical Cosine Projection

Yixian Shen, Qi Bi, Jia-Hong Huang, Hongyi Zhu, Andy D. Pimentel, Anuj Pathania

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视频理解 :video understanding(abstract)

Comments 17 pages; Previously this version appeared as arXiv:2505.23870 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2508.08248 2025-08-12 cs.CV 85%

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Shuyuan Tu, Yueming Pan, Yinming Huang, Xintong Han, Zhen Xing, Qi Dai, Chong Luo, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Hunyuan, Tencent Inc.(腾讯 Hunyuan 实验室)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 9 篇

2508.07149 2025-08-12 cs.CV 84%

SketchAnimator: Animate Sketch via Motion Customization of Text-to-Video Diffusion Models

Ruolin Yang, Da Li, Honggang Zhang, Yi-Zhe Song

机构 * PRIS, School of Artificial Intelligence, Beijing University of Posts(PRIS人工智能学院,北京邮电大学) SketchX, CVSSP, University of Surrey(SketchX,计算机视觉与模式识别研究所,萨里大学)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);分类 cs.CV

Comments 2024 IEEE International Conference on Visual Communications and Image Processing (VCIP); Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08333 2025-08-12 cs.CV 79%

DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-trained Video Diffusion Models

Hyeonwoo Kim, Sangwon Baik, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://snuvclab.github.io/david/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17539 2025-08-12 cs.CV 79%

Generating, Fast and Slow: Scalable Parallel Video Generation with Video Interface Networks

Bhishma Dedhia, David Bourgin, Krishna Kumar Singh, Yuheng Li, Yan Kang, Zhan Xu, Niraj K. Jha, Yuchen Liu

机构 * Princeton University(普林斯顿大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video generation(title);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08086 2025-08-12 cs.CV cs.GR 70%

Matrix-3D: Omnidirectional Explorable 3D World Generation

Zhongqi Yang, Wenhang Ge, Yuqi Li, Jiaqi Chen, Haoyuan Li, Mengyin An, Fei Kang, Hua Xue, Baixin Xu, Yuyang Yin, Eric Li, Yang Liu, Yikai Wang, Hao-Xiang Guo, Yahui Zhou

机构 * Skywork AI Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07905 2025-08-12 cs.CV 57%

Generative Video Matting

Yongtao Ge, Kangyang Xie, Guangkai Xu, Mingyu Liu, Li Ke, Longtao Huang, Hui Xue, Hao Chen, Chunhua Shen

机构 * The University of Adelaide(阿德莱德大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Journal ref SIGGRAPH Conference Papers 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07603 2025-08-12 cs.CV 57%

LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation

Wenhui Song, Hanhui Li, Jiehui Huang, Panwen Hu, Yuhao Cheng, Long Chen, Yiqiang Yan, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hong Kong University of Science and Technology(香港科学与技术大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) Lenovo Research(联想研究)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07557 2025-08-12 cs.CV 57%

Splat4D: Diffusion-Enhanced 4D Gaussian Splatting for Temporally and Spatially Consistent Content Creation

Minghao Yin, Yukang Cao, Songyou Peng, Kai Han

机构 * The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07246 2025-08-12 cs.CV 57%

Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers

Xin Ma, Yaohui Wang, Genyun Jia, Xinyuan Chen, Tien-Tsin Wong, Cunjian Chen

机构 * Department of Data Science & AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,墨尔本大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Project Page: https://maxin-cn.github.io/miramo_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21205 2025-08-12 cs.CV 57%

EF-VI: Enhancing End-Frame Injection for Video Inbetweening

Liuhan Chen, Xiaodong Cun, Xiaoyu Li, Xianyi He, Shenghai Yuan, Jie Chen, Ying Shan, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) GVC Lab, Great Bay University(大湾大学GVC实验室) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Rabbitpre Intelligence(Rabbitpre智能)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2508.07989 2025-08-12 cs.CV cs.HC 57%

The Escalator Problem: Identifying Implicit Motion Blindness in AI for Accessibility

Xiantao Zhang

机构 * Beihang University(北航大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments 9 pages, 3 figures, 2 tables. Accepted at CV4A11y, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2508.08082 2025-08-12 cs.CV 57%

ME-TST+: Micro-expression Analysis via Temporal State Transition with ROI Relationship Awareness

Zizheng Guo, Bochao Zou, Junbao Zhuo, Huimin Ma

机构 * School of Computer and Communication Engineering, University of Science and Technology Beijing(信息与通信工程学院,北京科技大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07543 2025-08-12 cs.CV cs.LG 57%

Commentary Generation for Soccer Highlights

Chidaksh Ravuru

机构 * cs.unc.edu(北卡罗来纳大学教堂山分校计算机科学系)

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 2 篇

2406.08035 2025-08-12 cs.CV cs.AI 88%

LVBench: An Extreme Long Video Understanding Benchmark

Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Xiaotao Gu, Shiyu Huang, Bin Xu, Yuxiao Dong, Ming Ding, Jie Tang

机构 * Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07554 2025-08-12 cs.MM 79%

FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding

Xusheng He, Wei Liu, Shanshan Ma, Qian Liu, Chenghao Ma, Jianlong Wu

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏