arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2210.06433 2025-01-13 cs.CV cs.AI cs.LG 57%

Self-supervised video pretraining yields robust and more human-aligned visual representations

Nikhil Parthasarathy, S. M. Ali Eslami, João Carreira, Olivier J. Hénaff

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to 37th Conference on Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00432 2025-01-03 cs.CV cs.LG 57%

OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models

Lala Shakti Swarup Ray, Bo Zhou, Sungho Suh, Paul Lukowicz

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted in IEEE ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00136 2025-01-03 cs.CV cs.AI cs.LG 57%

Detection-Fusion for Knowledge Graph Extraction from Videos

Taniya Das, Louis Mahon, Thomas Lukasiewicz

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 12 pages, To be submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17759 2024-12-24 cs.AI cs.CV cs.LG 57%

Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy

Priyaranjan Pattnayak, Hitesh Laxmichand Patel, Bhargava Kumar, Amit Agarwal, Ishan Banerjee, Srikant Panda, Tejaswini Kumar

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16946 2024-12-24 cs.CV 57%

Video Domain Incremental Learning for Human Action Recognition in Home Environments

Yuanda Hu, Xing Liu, Meiying Li, Yate Ge, Xiaohua Sun, Weiwei Guo

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16117 2024-12-23 cs.CV 57%

PruneVid: Visual Token Pruning for Efficient Video Large Language Models

Xiaohu Huang, Hao Zhou, Kai Han

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Efficient Video Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14006 2024-12-19 cs.CV 57%

InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models

Cong Wei, Yujie Zhong, Haoxian Tan, Yingsen Zeng, Yong Liu, Zheng Zhao, Yujiu Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12675 2024-12-18 cs.CV 57%

ShotVL: Human-Centric Highlight Frame Retrieval via Language Queries

Wangyu Xue, Chen Qian, Jiayi Wu, Yang Zhou, Wentao Liu, Ju Ren, Siming Fan, Yaoxue Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11228 2024-12-17 cs.CV cs.AI cs.LG 57%

Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition

Yulin Wang, Haoji Zhang, Yang Yue, Shiji Song, Chao Deng, Junlan Feng, Gao Huang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by IEEE TPAMI. Journal version of arXiv:2105.03245 (AdaFocusV1, ICCV 2021 Oral), arXiv:2112.14238 (AdaFocusV2, CVPR 2022), and arXiv:2209.13465 (AdaFocusV3, ECCV 2022). Code and pre-trained models: https://github.com/LeapLabTHU/Uni-AdaFocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12519 2024-12-10 cs.CV 57%

Dynamics Based Neural Encoding with Inter-Intra Region Connectivity

Mai Gamal, Mohamed Rashad, Eman Ehab, Seif Eldawlatly, Mennatullah Siam

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Title change

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19644 2024-11-28 cs.CV cs.AI cs.LG 57%

EgoSurgery-Phase: A Dataset of Surgical Phase Recognition from Egocentric Open Surgery Videos

Ryo Fujii, Masashi Hatano, Hideo Saito, Hiroki Kajita

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Early accepted by MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14205 2024-11-22 cs.CV cs.AI 57%

Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-body

Zeqing Wang, Qingyang Ma, Wentao Wan, Haojie Li, Keze Wang, Yonghong Tian

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments 16 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13683 2024-11-22 cs.CV 57%

Extending Video Masked Autoencoders to 128 frames

Nitesh Bharadwaj Gundavarapu, Luke Friedman, Raghav Goyal, Chaitra Hegde, Eirikur Agustsson, Sagar M. Waghmare, Mikhail Sirotenko, Ming-Hsuan Yang, Tobias Weyand, Boqing Gong, Leonid Sigal

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 10.5 pages of main paper, 25 pages total, 4 figures and 10 tables. To appear in NeurIPS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11066 2024-11-19 cs.CV 57%

TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models

Tingyu Qu, Mingxiao Li, Tinne Tuytelaars, Marie-Francine Moens

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13800 2024-11-18 cs.CV cs.AI 57%

Dense Connector for MLLMs

Huanjin Yao, Wenhao Wu, Taojiannan Yang, YuXin Song, Mengxi Zhang, Haocheng Feng, Yifan Sun, Zhiheng Li, Wanli Ouyang, Jingdong Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 27 pages, NeurIPS 2024

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19006 2024-11-14 cs.CV 57%

Snakes and Ladders: Two Steps Up for VideoMamba

Hui Lu, Albert Ali Salah, Ronald Poppe

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments New updated experiment results

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05636 2024-11-11 cs.CV cs.LG 57%

Video RWKV:Video Action Recognition Based RWKV

Zhuowen Yin, Chengru Li, Xingbo Dong

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01335 2024-11-04 cs.CV cs.AI 57%

BehAVE: Behaviour Alignment of Video Game Encodings

Nemanja Rašajski, Chintan Trivedi, Konstantinos Makantasis, Antonios Liapis, Georgios N. Yannakakis

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03326 2024-10-29 cs.CV cs.AI cs.CL 57%

LLaVA-OneVision: Easy Visual Task Transfer

Bo Li, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Peiyuan Zhang, Yanwei Li, Ziwei Liu, Chunyuan Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Project Homepage: https://llava-vl.github.io/blog/2024-08-05-llava-onevision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17327 2024-10-24 cs.CV 57%

Telling Stories for Common Sense Zero-Shot Action Recognition

Shreyank N Gowda, Laura Sevilla-Lara

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted in ACCV 2024!

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10441 2024-10-17 cs.CV cs.AI 57%

Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs

Kai Han, Jianyuan Guo, Yehui Tang, Wei He, Enhua Wu, Yunhe Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09875 2024-10-15 cs.CV cs.IR 57%

ViFi-ReID: A Two-Stream Vision-WiFi Multimodal Approach for Person Re-identification

Chen Mao, Chong Tan, Jingqi Hu, Min Zheng

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07405 2024-10-11 cs.CV cs.AI 57%

Exploring Efficient Foundational Multi-modal Models for Video Summarization

Karan Samel, Apoorva Beedu, Nitish Sontakke, Irfan Essa

专题命中 视频理解 :video language model(abstract);分类 cs.CV

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04511 2024-10-08 cs.CV cs.CL 57%

Realizing Video Summarization from the Path of Language-based Semantic Understanding

Kuan-Chen Mu, Zhi-Yi Chin, Wei-Chen Chiu

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17041 2024-10-04 cs.CV cs.AI cs.CL 57%

Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties

Keunwoo Peter Yu, Zheyuan Zhang, Fengyuan Hu, Shane Storks, Joyce Chai

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 16 pages, LaTeX; Accepted to EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04886 2024-10-03 cs.CV cs.AI cs.CL 57%

Unveiling the Invisible: Captioning Videos with Metaphors

Abisek Rajakumar Kalarani, Pushpak Bhattacharyya, Sumit Shekhar

专题命中 视频理解 :video language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19389 2024-10-02 cs.CV 57%

OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding

Tao Zhang, Xiangtai Li, Hao Fei, Haobo Yuan, Shengqiong Wu, Shunping Ji, Chen Change Loy, Shuicheng Yan

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments NeurIPS-2024. Project page: https://lxtgh.github.io/project/omg_llava/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20566 2024-10-01 cs.CV cs.CL cs.LG 57%

MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning

Haotian Zhang, Mingfei Gao, Zhe Gan, Philipp Dufter, Nina Wenzel, Forrest Huang, Dhruti Shah, Xianzhi Du, Bowen Zhang, Yanghao Li, Sam Dodge, Keen You, Zhen Yang, Aleksei Timofeev, Mingze Xu, Hong-You Chen, Jean-Philippe Fauconnier, Zhengfeng Lai, Haoxuan You, Zirui Wang, Afshin Dehghan, Peter Grasch, Yinfei Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15035 2024-09-24 cs.CV cs.CL 57%

Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP

Zeliang Zhang, Zhuo Liu, Mingqian Feng, Chenliang Xu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Short paper. Accepted by the Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13091 2024-09-23 cs.CV cs.AI 57%

Interpretable Action Recognition on Hard to Classify Actions

Anastasia Anichenko, Frank Guerin, Andrew Gilbert

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 5 pages, This manuscript has been accepted at the Human-inspired Computer Vision (HCV) ECCV 2024 Workshop. arXiv admin note: text overlap with arXiv:2107.05319

详情

展开后加载摘要…

URL PDF HTML 收藏