arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1395 篇

2504.01328 2025-04-03 cs.CV 57%

Slow-Fast Architecture for Video Multi-Modal Large Language Models

Min Shi, Shihao Wang, Chieh-Yun Chen, Jitesh Jain, Kai Wang, Junjun Xiong, Guilin Liu, Zhiding Yu, Humphrey Shi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24096 2025-04-01 cs.CV 57%

DANTE-AD: Dual-Vision Attention Network for Long-Term Audio Description

Adrienne Deganutti, Simon Hadfield, Andrew Gilbert

机构 * University of Surrey(萨里大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19706 2025-04-01 cs.CV cs.AI 57%

Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video Representations

Jungin Park, Jiyoung Lee, Kwanghoon Sohn

机构 * Yonsei University(延世大学) Ewha Womans University(梨花女子大学) NAVER AI Lab(NAVER AI实验室) Korea Institute of Science and Technology (KIST)(韩国科学技术研究院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2025 Camera-ready, 18 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00161 2025-04-01 cs.CV cs.LG 57%

STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training

Haiyi Qiu, Minghe Gao, Long Qian, Kaihang Pan, Qifan Yu, Juncheng Li, Wenjie Wang, Siliang Tang, Yueting Zhuang, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22233 2025-04-01 cs.CV cs.AI cs.IR 57%

ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising

Ashutosh Chaubey, Anoubhav Agarwaal, Sartaki Sinha Roy, Aayush Agrawal, Susmita Ghose

机构 * Anoki Inc.(安诺基公司) University of Southern California(南加州大学)

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments Published at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02071 2025-03-27 cs.CV 57%

Progress-Aware Video Frame Captioning

Zihui Xue, Joungbin An, Xitong Yang, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2025, Project website: https://vision.cs.utexas.edu/projects/ProgressCaptioner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09390 2025-03-27 cs.CV cs.LG 57%

LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of Living

Dominick Reilly, Rajatsubhra Chakraborty, Arkaprava Sinha, Manish Kumar Govind, Pu Wang, Francois Bremond, Le Xue, Srijan Das

机构 * UNC Charlotte(北卡罗来纳大学夏洛特分校) Salesforce AI Research(Salesforce人工智能研究部) Inria(法国国家信息与自动化研究所)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19794 2025-03-26 cs.CV cs.AI cs.LG 57%

PAVE: Patching and Adapting Video Large Language Models

Zhuoming Liu, Yiquan Li, Khoi Duc Nguyen, Yiwu Zhong, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18808 2025-03-25 cs.CV 57%

CRCL: Causal Representation Consistency Learning for Anomaly Detection in Surveillance Videos

Yang Liu, Hongjin Wang, Zepu Wang, Xiaoguang Zhu, Jing Liu, Peng Sun, Rui Tang, Jianwei Du, Victor C. M. Leung, Liang Song

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted for publication by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18637 2025-03-25 cs.CV 57%

Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks

Nina Shvetsova, Arsha Nagrani, Bernt Schiele, Hilde Kuehne, Christian Rupprecht

机构 * Goethe University Frankfurt(法兰克福大学) University of Tuebingen(蒂宾根大学) University of Oxford(牛津大学) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments To be published at CVPR 2025, project webpage https://utd-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16848 2025-03-25 cs.CV 57%

Multiple Object Tracking as ID Prediction

Ruopeng Gao, Ji Qi, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) China Mobile (Suzhou) Software Technology Co., Ltd.(中国移动(苏州)软件技术有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17827 2025-03-25 cs.CV 57%

4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding

Wenxuan Zhu, Bing Li, Cheng Zheng, Jinjie Mai, Jun Chen, Letian Jiang, Abdullah Hamdi, Sara Rojas Martinez, Chia-Wen Lin, Mohamed Elhoseiny, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) University of Oxford(牛津大学) National Tsing Hua University(国立清华大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08326 2025-03-25 cs.CV 57%

Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks

Miran Heo, Min-Hung Chen, De-An Huang, Sifei Liu, Subhashree Radhakrishnan, Seon Joo Kim, Yu-Chiang Frank Wang, Ryo Hachiuma

机构 * NVIDIA(英伟达) Yonsei University(延世大学) National Taiwan University(台湾大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2025, Project page: https://miranheo.github.io/omni-rgpt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16036 2025-03-21 cs.CV cs.AI cs.CL 57%

Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models

Zhihang Liu, Chen-Wei Xie, Pandeng Li, Liming Zhao, Longxiang Tang, Yun Zheng, Chuanbin Liu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18908 2025-03-21 cs.LG cs.CL cs.CV 57%

Wolf: Dense Video Captioning with a World Summarization Framework

Boyi Li, Ligeng Zhu, Ran Tian, Shuhan Tan, Yuxiao Chen, Yao Lu, Yin Cui, Sushant Veer, Max Ehrlich, Jonah Philion, Xinshuo Weng, Fuzhao Xue, Linxi Fan, Yuke Zhu, Jan Kautz, Andrew Tao, Ming-Yu Liu, Sanja Fidler, Boris Ivanovic, Trevor Darrell, Jitendra Malik, Song Han, Marco Pavone

机构 * NVIDIA(英伟达) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院) UT Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) Stanford University(斯坦福大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13724 2025-03-19 cs.CV 57%

Towards Scalable Modeling of Compressed Videos for Efficient Action Recognition

Shristi Das Biswas, Efstathia Soufleri, Arani Roy, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21113 2025-03-19 cs.CV cs.CL 57%

Zero-Shot Action Recognition in Surveillance Videos

Joao Pereira, Vasco Lopes, David Semedo, Joao Neves

机构 * NOVALINCS, NOVA School of Science and Technology(NOVALINCS、NOVA科学技术学院) NOVALINCS, Universidade da Beira Interior(NOVALINCS、贝拉内瓦大学) DeepNeuronic

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12332 2025-03-18 cs.CV 57%

VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining

Yunze Liu, Peiran Wu, Cheng Liang, Junxiao Shen, Limin Wang, Li Yi

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Bristol(布里斯托大学) Nanjing University(南京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11205 2025-03-17 cs.CV 57%

LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs

Leqi Shen, Tao He, Guoqiang Gong, Fan Yang, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) GRG Banking Equipment Co., Ltd.(广电运通金融电子股份有限公司) South China University of Technology(华南理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13317 2025-03-14 cs.CV 57%

Teaching VLMs to Localize Specific Objects from In-context Examples

Sivan Doveh, Nimrod Shabtay, Wei Lin, Eli Schwartz, Hilde Kuehne, Raja Giryes, Rogerio Feris, Leonid Karlinsky, James Glass, Assaf Arbelle, Shimon Ullman, M. Jehanzeb Mirza

机构 * IBM Research(IBM研究院) Weizmann Institute of Science(魏茨曼科学研究所) Tel Aviv University(特拉维夫大学) JKU Linz(林茨约翰内斯·开普勒大学) Tuebingen AI Center(蒂宾根人工智能中心) MIT-IBM(麻省理工学院-IBM联合机构) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06170 2025-03-13 cs.AI cs.CV cs.RO 57%

Object-Centric World Model for Language-Guided Manipulation

Youngjoon Jeong, Junha Chun, Soonwoo Cha, Taesup Kim

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08335 2025-03-12 cs.CV 57%

Prompt2LVideos: Exploring Prompts for Understanding Long-Form Multimodal Videos

Soumya Shamarao Jahagirdar, Jayasree Saha, C V Jawahar

机构 * Center for Visual Information Technology, IIIT Hyderabad(印度海得拉巴国际信息技术学院视觉信息技术中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVIP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10443 2025-03-12 cs.CV cs.AI 57%

SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization

Zhentao Tan, Ben Xue, Jian Jia, Junhao Wang, Wencai Ye, Shaoyun Shi, Mingjie Sun, Wenjin Wu, Quan Chen, Peng Jiang

机构 * Kuaishou Technology(快手科技)

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00986 2025-03-04 cs.CV 57%

Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning

Baoqi Pei, Yifei Huang, Jilan Xu, Guo Chen, Yuping He, Lijin Yang, Yali Wang, Weidi Xie, Yu Qiao, Fei Wu, Limin Wang

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Tokyo(东京大学) Fudan University(复旦大学) Nanjing University(南京大学) SIAT(中国科学院深圳先进技术研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted as ICLR 2025 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12961 2025-02-28 cs.CV 57%

Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution

Zuyan Liu, Yuhao Dong, Ziwei Liu, Winston Hu, Jiwen Lu, Yongming Rao

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03879 2025-02-27 cs.SD cs.MM eess.AS 57%

SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data

Liqian Zhang, Magdalena Fuentes

机构 * New York University(纽约大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.MM

Comments The paper has been accepted for ICASSP 2025, updating the latest camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06006 2025-02-18 cs.CV cs.AI 57%

SoccerNet 2023 Challenges Results

Anthony Cioppa, Silvio Giancola, Vladimir Somers, Floriane Magera, Xin Zhou, Hassan Mkhallati, Adrien Deliège, Jan Held, Carlos Hinojosa, Amir M. Mansourian, Pierre Miralles, Olivier Barnich, Christophe De Vleeschouwer, Alexandre Alahi, Bernard Ghanem, Marc Van Droogenbroeck, Abdullah Kamal, Adrien Maglo, Albert Clapés, Amr Abdelaziz, Artur Xarles, Astrid Orcesi, Atom Scott, Bin Liu, Byoungkwon Lim, Chen Chen, Fabian Deuser, Feng Yan, Fufu Yu, Gal Shitrit, Guanshuo Wang, Gyusik Choi, Hankyul Kim, Hao Guo, Hasby Fahrudin, Hidenari Koguchi, Håkan Ardö, Ibrahim Salah, Ido Yerushalmy, Iftikar Muhammad, Ikuma Uchida, Ishay Be'ery, Jaonary Rabarisoa, Jeongae Lee, Jiajun Fu, Jianqin Yin, Jinghang Xu, Jongho Nang, Julien Denize, Junjie Li, Junpei Zhang, Juntae Kim, Kamil Synowiec, Kenji Kobayashi, Kexin Zhang, Konrad Habel, Kota Nakajima, Licheng Jiao, Lin Ma, Lizhi Wang, Luping Wang, Menglong Li, Mengying Zhou, Mohamed Nasr, Mohamed Abdelwahed, Mykola Liashuha, Nikolay Falaleev, Norbert Oswald, Qiong Jia, Quoc-Cuong Pham, Ran Song, Romain Hérault, Rui Peng, Ruilong Chen, Ruixuan Liu, Ruslan Baikulov, Ryuto Fukushima, Sergio Escalera, Seungcheon Lee, Shimin Chen, Shouhong Ding, Taiga Someya, Thomas B. Moeslund, Tianjiao Li, Wei Shen, Wei Zhang, Wei Li, Wei Dai, Weixin Luo, Wending Zhao, Wenjie Zhang, Xinquan Yang, Yanbiao Ma, Yeeun Joo, Yingsen Zeng, Yiyang Gan, Yongqiang Zhu, Yujie Zhong, Zheng Ruan, Zhiheng Li, Zhijian Huang, Ziyu Meng

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07161 2025-02-12 cs.CV cs.AI 57%

A Survey on Mamba Architecture for Vision Applications

Fady Ibrahim, Guangjun Liu, Guanghui Wang

机构 * Toronto Metropolitan University(多伦多都会大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00094 2025-02-06 cs.CV cs.AI cs.CL cs.HC cs.LG 57%

AIN: The Arabic INclusive Large Multimodal Model

Ahmed Heakl, Sara Ghaboura, Omkar Thawkar, Fahad Shahbaz Khan, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林雪平大学) Aalto University(阿尔托大学) Australian National University(澳大利亚国立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 20 pages, 16 figures, ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11007 2025-02-04 cs.CV cs.LG 57%

HFGCN:Hypergraph Fusion Graph Convolutional Networks for Skeleton-Based Action Recognition

Pengcheng Dong, Wenbo Wan, Huaxiang Zhang, Shuai Li, Sujuan Hou, Jiande Sun

机构 * School of Information Science and Engineering, Shandong Normal University(山东师范大学信息科学与工程学院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏