arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2310.04991 2023-10-12 cs.CV 57%

Video-Teller: Enhancing Cross-Modal Generation with Fusion and Decoupling

Haogeng Liu, Qihang Fan, Tingkai Liu, Linjie Yang, Yunzhe Tao, Huaibo Huang, Ran He, Hongxia Yang

专题命中 视频理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10783 2023-09-20 cs.CV cs.AI cs.CL 57%

Language as the Medium: Multimodal Video Classification through text only

Laura Hanu, Anita L. Verő, James Thewlis

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at "What is Next in Multimodal Foundation Models?" (MMFM) workshop at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14965 2023-08-30 cs.CV 57%

CEFHRI: A Communication Efficient Federated Learning Framework for Recognizing Industrial Human-Robot Interaction

Umar Khalid, Hasan Iqbal, Saeed Vahidian, Jing Hua, Chen Chen

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted in IROS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14274 2023-08-29 cs.MM 57%

Parameter-Efficient Transfer Learning for Audio-Visual-Language Tasks

Hongye Liu, Xianhai Xie, Yang Gao, Size Li, Zhou YU

专题命中 视频理解 :video understanding(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09245 2023-08-21 cs.CV cs.AI 57%

Masked Spatio-Temporal Structure Prediction for Self-supervised Learning on Point Cloud Videos

Zhiqiang Shen, Xiaoxiao Sheng, Hehe Fan, Longguang Wang, Yulan Guo, Qiong Liu, Hao Wen, Xi Zhou

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07918 2023-08-16 cs.CV 57%

Helping Hands: An Object-Aware Ego-Centric Video Recognition Model

Chuhan Zhang, Ankush Gupta, Andrew Zisserman

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08265 2023-08-08 cs.CV cs.LG 57%

Vehicle Detection and Classification without Residual Calculation: Accelerating HEVC Image Decoding with Random Perturbation Injection

Muhammet Sebul Beratoğlu, Behçet Uğur Töreyin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 10 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.03740 2023-07-19 cs.CV 57%

Convolutional Hierarchical Attention Network for Query-Focused Video Summarization

Shuwen Xiao, Zhou Zhao, Zijian Zhang, Xiaohui Yan, Min Yang

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments Accepted by AAAI 2020 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07483 2023-07-19 cs.CV 57%

Multimodal Distillation for Egocentric Action Recognition

Gorjan Radevski, Dusan Grujicic, Marie-Francine Moens, Matthew Blaschko, Tinne Tuytelaars

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at ICCV 2023; Codebase released at https://github.com/gorjanradevski/multimodal-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12005 2023-07-06 cs.CL cs.CV 57%

mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections

Chenliang Li, Haiyang Xu, Junfeng Tian, Wei Wang, Ming Yan, Bin Bi, Jiabo Ye, Hehong Chen, Guohai Xu, Zheng Cao, Ji Zhang, Songfang Huang, Fei Huang, Jingren Zhou, Luo Si

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Journal ref EMNLP2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13118 2023-06-26 cs.AI cs.CV cs.IR 57%

An overview on the evaluated video retrieval tasks at TRECVID 2022

George Awad, Keith Curtis, Asad Butt, Jonathan Fiscus, Afzal Godil, Yooyoung Lee, Andrew Delgado, Eliot Godard, Lukas Diduch, Jeffrey Liu, Yvette Graham, Georges Quenot

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2104.13473, arXiv:2009.09984

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13292 2023-05-24 cs.CV 57%

VideoLLM: Modeling Video Sequence with Large Language Models

Guo Chen, Yin-Dong Zheng, Jiahao Wang, Jilan Xu, Yifei Huang, Junting Pan, Yi Wang, Yali Wang, Yu Qiao, Tong Lu, Limin Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06378 2023-05-18 cs.CV 57%

Learning Grounded Vision-Language Representation for Versatile Understanding in Untrimmed Videos

Teng Wang, Jinrui Zhang, Feng Zheng, Wenhao Jiang, Ran Cheng, Ping Luo

专题命中 视频理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00355 2023-05-05 cs.CV cs.AI 57%

MH-DETR: Video Moment and Highlight Detection with Cross-modal Transformer

Yifang Xu, Yunzhuo Sun, Yang Li, Yilei Shi, Xiaoxiang Zhu, Sidan Du

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10316 2023-04-21 cs.CV 57%

Search-Map-Search: A Frame Selection Paradigm for Action Recognition

Mingjun Zhao, Yakun Yu, Xiaoli Wang, Lei Yang, Di Niu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16579 2023-04-04 cs.CV 57%

INR-V: A Continuous Representation Space for Video-based Generative Tasks

Bipasha Sen, Aditya Agarwal, Vinay P Namboodiri, C. V. Jawahar

专题命中 视频理解 :video generation(abstract);分类 cs.CV

Comments Published in Transactions on Machine Learning Research (10/2022); https://openreview.net/forum?id=aIoEkwc2oB

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17636 2023-04-03 cs.CV 57%

Whether and When does Endoscopy Domain Pretraining Make Sense?

Dominik Batić, Felix Holm, Ege Özsoy, Tobias Czempiel, Nassir Navab

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17228 2023-03-31 cs.CV 57%

Streaming Video Model

Yucheng Zhao, Chong Luo, Chuanxin Tang, Dongdong Chen, Noel Codella, Zheng-Jun Zha

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13738 2023-03-31 cs.CV cs.CL 57%

TempCLR: Temporal Alignment Representation with Contrastive Learning

Yuncong Yang, Jiawei Ma, Shiyuan Huang, Long Chen, Xudong Lin, Guangxing Han, Shih-Fu Chang

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments ICLR 2023 Camera Ready. Code Link: https://github.com/yyuncong/TempCLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16268 2023-03-30 cs.CV cs.LG 57%

TimeBalance: Temporally-Invariant and Temporally-Distinctive Video Representations for Semi-Supervised Action Recognition

Ishan Rajendrakumar Dave, Mamshad Nayeem Rizve, Chen Chen, Mubarak Shah

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00182 2023-03-28 cs.CV 57%

Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models

Wenhao Wu, Xiaohan Wang, Haipeng Luo, Jingdong Wang, Yi Yang, Wanli Ouyang

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13874 2023-03-27 cs.CV cs.AI 57%

Query-Dependent Video Representation for Moment Retrieval and Highlight Detection

WonJun Moon, Sangeek Hyun, SangUk Park, Dongchan Park, Jae-Pil Heo

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR 2023. Code is available at https://github.com/wjun0830/QD-DETR

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09857 2023-03-20 cs.CV cs.LG 57%

Dual-path Adaptation from Image to Video Transformers

Jungin Park, Jiyoung Lee, Kwanghoon Sohn

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2023. Code is available at https://github.com/park-jungin/DualPath

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.17042 2023-03-14 cs.CV 57%

Spatio-Temporal Crop Aggregation for Video Representation Learning

Sepehr Sameni, Simon Jenni, Paolo Favaro

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15280 2023-03-14 cs.CV cs.AI 57%

Learning Transferable Spatiotemporal Representations from Natural Script Knowledge

Ziyun Zeng, Yuying Ge, Xihui Liu, Bin Chen, Ping Luo, Shu-Tao Xia, Yixiao Ge

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2023; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12688 2023-02-27 cs.CV cs.AI cs.LG 57%

Video4MRI: An Empirical Study on Brain Magnetic Resonance Image Analytics with CNN-based Video Classification Frameworks

Yuxuan Zhang, Qingzhong Wang, Jiang Bian, Yi Liu, Yanwu Xu, Dejing Dou, Haoyi Xiong

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by IEEE ISBI'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03024 2023-02-07 cs.CV 57%

AIM: Adapting Image Models for Efficient Video Action Recognition

Taojiannan Yang, Yi Zhu, Yusheng Xie, Aston Zhang, Chen Chen, Mu Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ICLR 2023. Project webpage is at https://adapt-image-models.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08846 2023-01-24 cs.LG cs.AI cs.CL cs.CV eess.AS 57%

Regeneration Learning: A Learning Paradigm for Data Generation

Xu Tan, Tao Qin, Jiang Bian, Tie-Yan Liu, Yoshua Bengio

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03769 2023-01-11 cs.CV 57%

Learning from What is Already Out There: Few-shot Sign Language Recognition with Online Dictionaries

Matyáš Boháček, Marek Hrúz

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments 6 pages, 2 figures, IEEE Face & Gestures 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.05162 2023-01-10 cs.CV cs.CL 57%

Video2Commonsense: Generating Commonsense Descriptions to Enrich Video Captioning

Zhiyuan Fang, Tejas Gokhale, Pratyay Banerjee, Chitta Baral, Yezhou Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments EMNLP 2020. V2C Website: https://asu-apg.github.io/Video2Commonsense/

详情

展开后加载摘要…

URL PDF HTML 收藏