arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1395 篇

2207.12795 2022-07-27 cs.CV cs.LG 57%

Static and Dynamic Concepts for Self-supervised Video Representation Learning

Rui Qian, Shuangrui Ding, Xian Liu, Dahua Lin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01375 2022-07-21 cs.CV cs.AI 57%

GraphVid: It Only Takes a Few Nodes to Understand a Video

Eitan Kosman, Dotan Di Castro

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ECCV2022 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08001 2022-07-19 cs.CV 57%

SVGraph: Learning Semantic Graphs from Instructional Videos

Madeline C. Schiappa, Yogesh S. Rawat

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 20 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06261 2022-07-14 cs.CV cs.LG 57%

Is Appearance Free Action Recognition Possible?

Filip Ilic, Thomas Pock, Richard P. Wildes

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.07624 2022-07-06 cs.CV 57%

Attention Mechanisms in Computer Vision: A Survey

Meng-Hao Guo, Tian-Xing Xu, Jiang-Jiang Liu, Zheng-Ning Liu, Peng-Tao Jiang, Tai-Jiang Mu, Song-Hai Zhang, Ralph R. Martin, Ming-Ming Cheng, Shi-Min Hu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 27 pages, 9 figures

Journal ref Computational Visual Media, 2022, Vol. 8, No. 3, 331-368

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.14555 2022-06-30 cs.CV cs.AI 57%

Technical Report for CVPR 2022 LOVEU AQTC Challenge

Hyeonyu Kim, Jongeun Kim, Jeonghun Kang, Sanguk Park, Dongchan Park, Taehwan Kim

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 4 pages, 3 figures, technical report for track3 of CVPR 2022 LOVEU challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.13478 2022-06-30 cs.CV 57%

Video Joint Modelling Based on Hierarchical Transformer for Co-summarization

Li Haopeng, Ke Qiuhong, Gong Mingming, Zhang Rui

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.13196 2022-06-22 cs.CV 57%

SwinBERT: End-to-End Transformers with Sparse Attention for Video Captioning

Kevin Lin, Linjie Li, Chung-Ching Lin, Faisal Ahmed, Zhe Gan, Zicheng Liu, Yumao Lu, Lijuan Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.10990 2022-06-20 cs.CV 57%

Learning To Recognize Procedural Activities with Distant Supervision

Xudong Lin, Fabio Petroni, Gedas Bertasius, Marcus Rohrbach, Shih-Fu Chang, Lorenzo Torresani

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments CVPR 2022. Code will be released here https://github.com/facebookresearch/video-distant-supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.06915 2022-06-13 cs.CV 57%

Object-Region Video Transformers

Roei Herzig, Elad Ben-Avraham, Karttikeya Mangalam, Amir Bar, Gal Chechik, Anna Rohrbach, Trevor Darrell, Amir Globerson

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02002 2022-06-07 cs.CV cs.LG 57%

CVNets: High Performance Library for Computer Vision

Sachin Mehta, Farzad Abdolhosseini, Mohammad Rastegari

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.04288 2022-06-01 cs.CV cs.LG 57%

Multiview Transformers for Video Recognition

Shen Yan, Xuehan Xiong, Anurag Arnab, Zhichao Lu, Mi Zhang, Chen Sun, Cordelia Schmid

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2022; arXiv v4: update results on Epic-Kitchens-100

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.01818 2022-05-06 cs.LG cs.AI cs.CL cs.CV eess.AS 57%

i-Code: An Integrative and Composable Multimodal Learning Framework

Ziyi Yang, Yuwei Fang, Chenguang Zhu, Reid Pryzant, Dongdong Chen, Yu Shi, Yichong Xu, Yao Qian, Mei Gao, Yi-Ling Chen, Liyang Lu, Yujia Xie, Robert Gmyr, Noel Codella, Naoyuki Kanda, Bin Xiao, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.12408 2022-04-27 cs.CV 57%

MILES: Visual BERT Pre-training with Injected Language Semantics for Video-text Retrieval

Yuying Ge, Yixiao Ge, Xihui Liu, Alex Jinpeng Wang, Jianping Wu, Ying Shan, Xiaohu Qie, Ping Luo

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.12293 2022-04-27 cs.CV 57%

Contrastive Language-Action Pre-training for Temporal Localization

Mengmeng Xu, Erhan Gundogdu, Maksim Lapin, Bernard Ghanem, Michael Donoser, Loris Bazzani

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.14104 2022-04-27 cs.CV 57%

Can An Image Classifier Suffice For Action Recognition?

Quanfu Fan, Chun-Fu, Chen, Rameswar Panda

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10916 2022-04-26 cs.CV cs.LG 57%

Revealing Occlusions with 4D Neural Fields

Basile Van Hoorick, Purva Tendulkar, Didac Suris, Dennis Park, Simon Stent, Carl Vondrick

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2022 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08874 2022-04-20 cs.CV 57%

Less than Few: Self-Shot Video Instance Segmentation

Pengwan Yang, Yuki M. Asano, Pascal Mettes, Cees G. M. Snoek

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 25 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08671 2022-04-20 cs.CV 57%

ActAR: Actor-Driven Pose Embeddings for Video Action Recognition

Soufiane Lamghari, Guillaume-Alexandre Bilodeau, Nicolas Saunier

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03141 2022-04-08 cs.CV cs.AI 57%

Adversarial Machine Learning Attacks Against Video Anomaly Detection Systems

Furkan Mumcu, Keval Doshi, Yasin Yilmaz

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.11297 2022-04-05 cs.CV cs.LG 57%

TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Michael S. Ryoo, AJ Piergiovanni, Anurag Arnab, Mostafa Dehghani, Anelia Angelova

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments This is the full version of the paper, extending its conference paper at NeurIPS 2021. Version 1.1 of the code is released

Journal ref NeurIPS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09212 2022-04-01 cs.CV cs.AI 57%

Long-Short Temporal Contrastive Learning of Video Transformers

Jue Wang, Gedas Bertasius, Du Tran, Lorenzo Torresani

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted in CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.07974 2022-03-31 cs.CV 57%

TCLR: Temporal Contrastive Learning for Video Representation

Ishan Dave, Rohit Gupta, Mamshad Nayeem Rizve, Mubarak Shah

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to Computer Vision and Image Understanding (CVIU) Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.15205 2022-03-30 cs.CV cs.CR cs.LG 57%

SPAct: Self-supervised Privacy Preservation for Action Recognition

Ishan Rajendrakumar Dave, Chen Chen, Mubarak Shah

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR-2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.15086 2022-03-30 cs.CV 57%

X-Pool: Cross-Modal Language-Video Attention for Text-Video Retrieval

Satya Krishna Gorti, Noel Vouitsis, Junwei Ma, Keyvan Golestan, Maksims Volkovs, Animesh Garg, Guangwei Yu

专题命中 视频理解 :video reasoning(abstract);分类 cs.CV

Comments CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.04850 2022-03-18 cs.CV 57%

Bridging Video-text Retrieval with Multiple Choice Questions

Yuying Ge, Yixiao Ge, Xihui Liu, Dian Li, Ying Shan, Xiaohu Qie, Ping Luo

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.02573 2022-03-08 cs.CV cs.AI cs.LG 57%

Show Me What and Tell Me How: Video Synthesis via Multimodal Conditioning

Ligong Han, Jian Ren, Hsin-Ying Lee, Francesco Barbieri, Kyle Olszewski, Shervin Minaee, Dimitris Metaxas, Sergey Tulyakov

专题命中 视频理解 :video generation(abstract);分类 cs.CV

Comments Accepted to CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10828 2022-02-23 cs.CV 57%

Exploiting long-term temporal dynamics for video captioning

Yuyu Guo, Jingqiu Zhang, Lianli Gao

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.09979 2022-02-22 cs.CL cs.CV 57%

Audio Visual Scene-Aware Dialog Generation with Transformer-based Video Representations

Yoshihiro Yamazaki, Shota Orihashi, Ryo Masumura, Mihiro Uchida, Akihiko Takashima

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at DSTC10 Workshop at AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12086 2022-02-16 cs.CV 57%

BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

Junnan Li, Dongxu Li, Caiming Xiong, Steven Hoi

专题命中 视频理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏