arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1395 篇

2312.13008 2023-12-21 cs.CV cs.AI cs.LG 57%

No More Shortcuts: Realizing the Potential of Temporal Self-Supervision

Ishan Rajendrakumar Dave, Simon Jenni, Mubarak Shah

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments AAAI 2024 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07378 2023-12-13 cs.CV 57%

X4D-SceneFormer: Enhanced Scene Understanding on 4D Point Cloud Videos through Cross-modal Knowledge Transfer

Linglin Jing, Ying Xue, Xu Yan, Chaoda Zheng, Dong Wang, Ruimao Zhang, Zhigang Wang, Hui Fang, Bin Zhao, Zhen Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04821 2023-12-08 cs.CV 57%

PromptonomyViT: Multi-Task Prompt Learning Improves Video Transformers using Synthetic Scene Data

Roei Herzig, Ofir Abramovich, Elad Ben-Avraham, Assaf Arbelle, Leonid Karlinsky, Ariel Shamir, Trevor Darrell, Amir Globerson

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17043 2023-11-29 cs.CV cs.CL 57%

LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models

Yanwei Li, Chengyao Wang, Jiaya Jia

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments Code is available at https://github.com/dvlab-research/LLaMA-VID

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11365 2023-11-13 cs.CV 57%

EgoEnv: Human-centric environment representations from egocentric video

Tushar Nagarajan, Santhosh Kumar Ramakrishnan, Ruta Desai, James Hillis, Kristen Grauman

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Published in NeurIPS 2023 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02559 2023-11-07 cs.CV 57%

Rotation Invariant Transformer for Recognizing Object in UAVs

Shuoyi Chen, Mang Ye, Bo Du

专题命中 视频理解 :video reasoning(abstract);分类 cs.CV

Comments ACM MM2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08763 2023-10-31 cs.CV 57%

Video-Mined Task Graphs for Keystep Recognition in Instructional Videos

Kumar Ashutosh, Santhosh Kumar Ramakrishnan, Triantafyllos Afouras, Kristen Grauman

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04991 2023-10-12 cs.CV 57%

Video-Teller: Enhancing Cross-Modal Generation with Fusion and Decoupling

Haogeng Liu, Qihang Fan, Tingkai Liu, Linjie Yang, Yunzhe Tao, Huaibo Huang, Ran He, Hongxia Yang

专题命中 视频理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10783 2023-09-20 cs.CV cs.AI cs.CL 57%

Language as the Medium: Multimodal Video Classification through text only

Laura Hanu, Anita L. Verő, James Thewlis

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at "What is Next in Multimodal Foundation Models?" (MMFM) workshop at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14965 2023-08-30 cs.CV 57%

CEFHRI: A Communication Efficient Federated Learning Framework for Recognizing Industrial Human-Robot Interaction

Umar Khalid, Hasan Iqbal, Saeed Vahidian, Jing Hua, Chen Chen

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted in IROS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14274 2023-08-29 cs.MM 57%

Parameter-Efficient Transfer Learning for Audio-Visual-Language Tasks

Hongye Liu, Xianhai Xie, Yang Gao, Size Li, Zhou YU

专题命中 视频理解 :video understanding(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09245 2023-08-21 cs.CV cs.AI 57%

Masked Spatio-Temporal Structure Prediction for Self-supervised Learning on Point Cloud Videos

Zhiqiang Shen, Xiaoxiao Sheng, Hehe Fan, Longguang Wang, Yulan Guo, Qiong Liu, Hao Wen, Xi Zhou

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07918 2023-08-16 cs.CV 57%

Helping Hands: An Object-Aware Ego-Centric Video Recognition Model

Chuhan Zhang, Ankush Gupta, Andrew Zisserman

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08265 2023-08-08 cs.CV cs.LG 57%

Vehicle Detection and Classification without Residual Calculation: Accelerating HEVC Image Decoding with Random Perturbation Injection

Muhammet Sebul Beratoğlu, Behçet Uğur Töreyin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 10 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.03740 2023-07-19 cs.CV 57%

Convolutional Hierarchical Attention Network for Query-Focused Video Summarization

Shuwen Xiao, Zhou Zhao, Zijian Zhang, Xiaohui Yan, Min Yang

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments Accepted by AAAI 2020 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07483 2023-07-19 cs.CV 57%

Multimodal Distillation for Egocentric Action Recognition

Gorjan Radevski, Dusan Grujicic, Marie-Francine Moens, Matthew Blaschko, Tinne Tuytelaars

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at ICCV 2023; Codebase released at https://github.com/gorjanradevski/multimodal-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12005 2023-07-06 cs.CL cs.CV 57%

mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections

Chenliang Li, Haiyang Xu, Junfeng Tian, Wei Wang, Ming Yan, Bin Bi, Jiabo Ye, Hehong Chen, Guohai Xu, Zheng Cao, Ji Zhang, Songfang Huang, Fei Huang, Jingren Zhou, Luo Si

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Journal ref EMNLP2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13118 2023-06-26 cs.AI cs.CV cs.IR 57%

An overview on the evaluated video retrieval tasks at TRECVID 2022

George Awad, Keith Curtis, Asad Butt, Jonathan Fiscus, Afzal Godil, Yooyoung Lee, Andrew Delgado, Eliot Godard, Lukas Diduch, Jeffrey Liu, Yvette Graham, Georges Quenot

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2104.13473, arXiv:2009.09984

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13292 2023-05-24 cs.CV 57%

VideoLLM: Modeling Video Sequence with Large Language Models

Guo Chen, Yin-Dong Zheng, Jiahao Wang, Jilan Xu, Yifei Huang, Junting Pan, Yi Wang, Yali Wang, Yu Qiao, Tong Lu, Limin Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06378 2023-05-18 cs.CV 57%

Learning Grounded Vision-Language Representation for Versatile Understanding in Untrimmed Videos

Teng Wang, Jinrui Zhang, Feng Zheng, Wenhao Jiang, Ran Cheng, Ping Luo

专题命中 视频理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00355 2023-05-05 cs.CV cs.AI 57%

MH-DETR: Video Moment and Highlight Detection with Cross-modal Transformer

Yifang Xu, Yunzhuo Sun, Yang Li, Yilei Shi, Xiaoxiang Zhu, Sidan Du

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10316 2023-04-21 cs.CV 57%

Search-Map-Search: A Frame Selection Paradigm for Action Recognition

Mingjun Zhao, Yakun Yu, Xiaoli Wang, Lei Yang, Di Niu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16579 2023-04-04 cs.CV 57%

INR-V: A Continuous Representation Space for Video-based Generative Tasks

Bipasha Sen, Aditya Agarwal, Vinay P Namboodiri, C. V. Jawahar

专题命中 视频理解 :video generation(abstract);分类 cs.CV

Comments Published in Transactions on Machine Learning Research (10/2022); https://openreview.net/forum?id=aIoEkwc2oB

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17636 2023-04-03 cs.CV 57%

Whether and When does Endoscopy Domain Pretraining Make Sense?

Dominik Batić, Felix Holm, Ege Özsoy, Tobias Czempiel, Nassir Navab

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17228 2023-03-31 cs.CV 57%

Streaming Video Model

Yucheng Zhao, Chong Luo, Chuanxin Tang, Dongdong Chen, Noel Codella, Zheng-Jun Zha

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13738 2023-03-31 cs.CV cs.CL 57%

TempCLR: Temporal Alignment Representation with Contrastive Learning

Yuncong Yang, Jiawei Ma, Shiyuan Huang, Long Chen, Xudong Lin, Guangxing Han, Shih-Fu Chang

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments ICLR 2023 Camera Ready. Code Link: https://github.com/yyuncong/TempCLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16268 2023-03-30 cs.CV cs.LG 57%

TimeBalance: Temporally-Invariant and Temporally-Distinctive Video Representations for Semi-Supervised Action Recognition

Ishan Rajendrakumar Dave, Mamshad Nayeem Rizve, Chen Chen, Mubarak Shah

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00182 2023-03-28 cs.CV 57%

Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models

Wenhao Wu, Xiaohan Wang, Haipeng Luo, Jingdong Wang, Yi Yang, Wanli Ouyang

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13874 2023-03-27 cs.CV cs.AI 57%

Query-Dependent Video Representation for Moment Retrieval and Highlight Detection

WonJun Moon, Sangeek Hyun, SangUk Park, Dongchan Park, Jae-Pil Heo

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR 2023. Code is available at https://github.com/wjun0830/QD-DETR

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09857 2023-03-20 cs.CV cs.LG 57%

Dual-path Adaptation from Image to Video Transformers

Jungin Park, Jiyoung Lee, Kwanghoon Sohn

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2023. Code is available at https://github.com/park-jungin/DualPath

详情

展开后加载摘要…

URL PDF HTML 收藏