arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2506.18883 2025-11-24 cs.CV 70%

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13161 2025-11-21 cs.CV 70%

Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning

通过结构化多视频协作推理增强视频大语言模型

Zhihao He, Tianyao He, Yun Xu, Tieyuan Chen, Huabin Liu, Chaofan Gan, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 视频理解 :video language model(abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出一种多视频协作框架,通过结构化视频表示和图融合模块提升视频大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08818 2025-10-13 cs.CV cs.AI 70%

D-CoDe: Scaling Image-Pretrained VLMs to Video via Dynamic Compression and Question Decomposition

Yiyang Huang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments This paper has been accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20444 2025-10-09 cs.LG cs.CV 70%

HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models

Haoran Li, Yingjie Qin, Baoyuan Ou, Lai Xu, Ruiwen Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Xiaohongshu Inc.(小红书公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24109 2025-09-30 cs.CV 70%

SVAC: Scaling Is All You Need For Referring Video Object Segmentation

Li Zhang, Haoxiang Gao, Zhihao Zhang, Luoxiao Huang, Tao Zhang

机构 * Columbia University New York, USA(哥伦比亚大学) Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学) New York University New York, USA(纽约大学) Wuhan University Wuhan, China(武汉大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments This paper is accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07680 2025-09-10 cs.CV cs.LG 70%

CAViAR: Critic-Augmented Video Agentic Reasoning

Sachit Menon, Ahmet Iscen, Arsha Nagrani, Tobias Weyand, Carl Vondrick, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00969 2025-09-10 cs.CV 70%

Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors

Xiangchen Wang, Jinrui Zhang, Teng Wang, Haigang Zhang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) The University of Hong Kong(香港大学) Shenzhen Polytechnic University(深圳职业技术大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments 17 pages, 8 figures, EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09919 2025-08-12 cs.CV cs.AI 70%

B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens

Zhuqiang Lu, Zhenfei Yin, Mengwei He, Zhihui Wang, Zicheng Liu, Zhiyong Wang, Kun Hu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) International School of Information Science and Engineering, Dalian University of Technology(大连理工大学信息科学与工程国际学院) Advanced Micro Devices(先进微器件公司) School of Science, Edith Cowan University(埃迪斯科文大学科学学院)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by ICCV2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02134 2025-08-05 cs.CV 70%

Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference

Kuo Wang, Quanlong Zheng, Junlin Xie, Yanhao Zhang, Jinguo Luo, Haonan Lu, Liang Lin, Fan Zhou, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) OPPO AI Center(OPPO人工智能中心) Research Institute(研究 institute) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Key Laboratory of Digital Living Network and Content Service(深圳数字生活网络与内容服务重点实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments published in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19651 2025-07-30 cs.CV cs.LG cs.PF 70%

PEVLM: Parallel Encoding for Vision-Language Models

Letian Kang, Shixian Luo, Yiqiang Li, Yuxin Yin, Shenxuan Zhou, Xiaoyang Yu, Jin Yang, Yong Wu

机构 * Li Auto Inc.(利自动公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03248 2025-07-30 cs.CV cs.AI cs.CL 70%

AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning

Yiwu Zhong, Zhuoming Liu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00469 2025-07-02 cs.CV cs.LG 70%

Bisecle: Binding and Separation in Continual Learning for Video Language Understanding

Yue Tan, Xiaoqian Hu, Hao Xue, Celso De Melo, Flora D. Salim

机构 * School of Computer Science University of New South Wales(计算机科学学院新南威尔士大学) School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院新南威尔士大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments 23 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17443 2025-06-27 cs.CV cs.AI cs.CL 70%

HERMES: temporal-coHERent long-forM understanding with Episodes and Semantics

Gueter Josmy Faure, Jia-Fong Yeh, Min-Hung Chen, Hung-Ting Su, Shang-Hong Lai, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) NVIDIA(NVIDIA公司) National Tsing Hua University(国立清华大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Accepted for ICCV 2025. Project page: https://joslefaure.github.io/assets/html/hermes.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05173 2025-06-02 cs.CV 70%

VideoRoPE: What Makes for Good Video Rotary Position Embedding?

Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Jian Tong, Haodong Duan, Qipeng Guo, Jiaqi Wang, Xipeng Qiu, Dahua Lin

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15529 2025-05-22 cs.CV 70%

Clapper: Compact Learning and Video Representation in VLMs

Lingyu Kong, Hongzhi Zhang, Jingyuan Zhang, Jianzhao Huang, Kunze Li, Qi Wang, Fuzheng Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技) Xi’an Jiaotong University(西安交通大学)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15447 2025-05-22 cs.CV cs.AI 70%

ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning

Ziqiang Xu, Qi Dai, Tian Xie, Yifan Yang, Kai Qiu, DongDong Chen, Zuxuan Wu, Chong Luo

机构 * Fudan University(复旦大学) Microsoft(微软公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17365 2025-04-30 cs.CV cs.CL 70%

TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation

Ling You, Wenxuan Huang, Xinni Xie, Xiangyi Wei, Bangyan Li, Shaohui Lin, Yang Li, Changbo Wang

机构 * East China Normal University(东华大学)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15271 2025-04-22 cs.CV 70%

Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models

Guo Chen, Zhiqi Li, Shihao Wang, Jindong Jiang, Yicheng Liu, Lidong Lu, De-An Huang, Wonmin Byeon, Matthieu Le, Tuomas Rintamaki, Tyler Poon, Max Ehrlich, Tuomas Rintamaki, Tyler Poon, Tong Lu, Limin Wang, Bryan Catanzaro, Jan Kautz, Andrew Tao, Zhiding Yu, Guilin Liu

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13122 2025-04-18 cs.CV cs.LG 70%

VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models

Haojian Huang, Haodong Chen, Shengqiong Wu, Meng Luo, Jinlan Fu, Xinya Du, Hanwang Zhang, Hao Fei

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Code and Data: https://github.com/HaroldChen19/VistaDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17651 2025-03-25 cs.CV 70%

Collaborative Temporal Consistency Learning for Point-supervised Natural Language Video Localization

Zhuo Tao, Liang Li, Qi Chen, Yunbin Tu, Zheng-Jun Zha, Ming-Hsuan Yang, Yuankai Qi, Qingming Huang

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16428 2025-03-21 cs.CL cs.CV 70%

XAttention: Block Sparse Attention with Antidiagonal Scoring

Ruyi Xu, Guangxuan Xiao, Haofeng Huang, Junxian Guo, Song Han

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14378 2025-03-19 cs.CV 70%

Impossible Videos

Zechen Bai, Hai Ci, Mike Zheng Shou

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00513 2025-03-19 cs.CV cs.IR cs.LG 70%

CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval

Yifan Xu, Xinhao Li, Yichun Yang, Desen Meng, Rui Huang, Limin Wang

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07207 2025-03-18 cs.CV cs.AI cs.CL 70%

Valley: Video Assistant with Large Language model Enhanced abilitY

Ruipu Luo, Ziwang Zhao, Min Yang, Zheming Yang, Minghui Qiu, Tao Wang, Zhongyu Wei, Yanhao Wang, Cen Chen

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09837 2025-03-17 cs.CV cs.AI cs.CL 70%

On the Limitations of Vision-Language Models in Understanding Image Transforms

Ahmad Mustafa Anis, Hasnain Ali, Saquib Sarfraz

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments 8 pages, 15 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09613 2024-12-13 cs.CV 70%

PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models

Chenyu Yang, Xuan Dong, Xizhou Zhu, Weijie Su, Jiahao Wang, Hao Tian, Zhe Chen, Wenhai Wang, Lewei Lu, Jifeng Dai

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06040 2024-10-28 cs.CV 70%

Vript: A Video Is Worth Thousands of Words

Dongjie Yang, Suyuan Huang, Chengqiang Lu, Xiaodong Han, Haoxin Zhang, Yan Gao, Yao Hu, Hai Zhao

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by NeurIPS Dataset & Benchmark track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11702 2024-10-16 cs.CV 70%

It's Just Another Day: Unique Video Captioning by Discriminative Prompting

Toby Perrett, Tengda Han, Dima Damen, Andrew Zisserman

专题命中 视频理解 :text-to-video(abstract);long video(abstract);分类 cs.CV

Comments ACCV 2024 Oral. Project page: https://tobyperrett.github.io/its-just-another-day/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04732 2024-09-13 cs.CV cs.AI 70%

VidLPRO: A $\underline{Vid}$eo-$\underline{L}$anguage $\underline{P}$re-training Framework for $\underline{Ro}$botic and Laparoscopic Surgery

Mohammadmahdi Honarmand, Muhammad Abdullah Jamal, Omid Mohareri

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16994 2024-04-30 cs.CV 70%

PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning

Lin Xu, Yilin Zhao, Daquan Zhou, Zhijie Lin, See Kiong Ng, Jiashi Feng

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏