arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1395 篇

2101.05061 2021-01-14 cs.CV cs.RO 57%

Understanding Action Sequences based on Video Captioning for Learning-from-Observation

Iori Yanokura, Naoki Wake, Kazuhiro Sasabuchi, Katsushi Ikeuchi, Masayuki Inaba

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13046 2020-11-30 cs.CV 57%

Can Temporal Information Help with Contrastive Self-Supervised Learning?

Yutong Bai, Haoqi Fan, Ishan Misra, Ganesh Venkatesh, Yongyi Lu, Yuyin Zhou, Qihang Yu, Vikas Chandra, Alan Yuille

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.09046 2020-11-25 cs.CV cs.CL 57%

A Hierarchical Multi-Modal Encoder for Moment Localization in Video Corpus

Bowen Zhang, Hexiang Hu, Joonseok Lee, Ming Zhao, Sheide Chammas, Vihan Jain, Eugene Ie, Fei Sha

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.14810 2020-10-29 cs.CV cs.LG 57%

Cycle-Contrast for Self-Supervised Video Representation Learning

Quan Kong, Wenpeng Wei, Ziwei Deng, Tomoaki Yoshinaga, Tomokazu Murakami

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.14338 2020-10-19 cs.CL cs.CV 57%

Beyond Instructional Videos: Probing for More Diverse Visual-Textual Grounding on YouTube

Jack Hessel, Zhenhai Zhu, Bo Pang, Radu Soricut

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 11 pages including supplementary materials

Journal ref Published in EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.03019 2020-10-15 cs.CV cs.LG 57%

Global Self-Attention Networks for Image Recognition

Zhuoran Shen, Irwan Bello, Raviteja Vemulapalli, Xuhui Jia, Ching-Hui Chen

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.06430 2020-08-25 cs.CV 57%

End-to-End Learning of Visual Representations from Uncurated Instructional Videos

Antoine Miech, Jean-Baptiste Alayrac, Lucas Smaira, Ivan Laptev, Josef Sivic, Andrew Zisserman

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments CVPR'2020 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.01057 2020-08-04 cs.CV 57%

Residual Frames with Efficient Pseudo-3D CNN for Human Action Recognition

Jiawei Chen, Jenson Hsiao, Chiu Man Ho

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.00936 2020-08-04 cs.CV 57%

Detection and Localization of Robotic Tools in Robot-Assisted Surgery Videos Using Deep Neural Networks for Region Proposal and Detection

Duygu Sarikaya, Jason J. Corso, Khurshid A. Guru

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Journal ref IEEE Transactions on Medical Imaging 36 (2017) 1542-1549

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.00998 2020-06-11 cs.CV 57%

A Multigrid Method for Efficiently Training Video Models

Chao-Yuan Wu, Ross Girshick, Kaiming He, Christoph Feichtenhofer, Philipp Krähenbühl

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13209 2020-05-28 cs.CV cs.LG cs.NE 57%

AssembleNet: Searching for Multi-Stream Neural Connectivity in Video Architectures

Michael S. Ryoo, AJ Piergiovanni, Mingxing Tan, Anelia Angelova

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Journal ref ICLR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.09260 2020-05-22 cs.CV cs.RO 57%

4D Generic Video Object Proposals

Aljosa Osep, Paul Voigtlaender, Mark Weber, Jonathon Luiten, Bastian Leibe

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ICRA 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.08206 2020-04-23 cs.CV 57%

Mimic The Raw Domain: Accelerating Action Recognition in the Compressed Domain

Barak Battash, Haim Barad, Hanlin Tang, Amit Bleiweiss

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2020: Joint Workshop on Efficient Deep Learning in Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.09087 2020-03-23 cs.CV 57%

Fully Automated Hand Hygiene Monitoring\\in Operating Room using 3D Convolutional Neural Network

Minjee Kim, Joonmyeong Choi, Namkug Kim

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.05614 2020-03-13 cs.CV 57%

Beyond the Camera: Neural Networks in World Coordinates

Gunnar A. Sigurdsson, Abhinav Gupta, Cordelia Schmid, Karteek Alahari

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.01442 2020-03-10 cs.CV cs.AI cs.CL cs.LG 57%

CLEVRER: CoLlision Events for Video REpresentation and Reasoning

Kexin Yi, Chuang Gan, Yunzhu Li, Pushmeet Kohli, Jiajun Wu, Antonio Torralba, Joshua B. Tenenbaum

专题命中 视频理解 :video reasoning(abstract);分类 cs.CV

Comments The first two authors contributed equally to this work. Accepted as Oral Spotlight as ICLR 2020. Project page: http://clevrer.csail.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.03152 2020-02-11 cs.CV 57%

CTM: Collaborative Temporal Modeling for Action Recognition

Qian Liu, Tao Wang, Jie Liu, Yang Guan, Qi Bu, Longfei Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.06680 2020-01-22 cs.CV 57%

Tree-Structured Policy based Progressive Reinforcement Learning for Temporally Language Grounding in Video

Jie Wu, Guanbin Li, Si Liu, Liang Lin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments To appear in AAAI2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11961 2019-11-28 cs.CV 57%

AdapNet: Adaptability Decomposing Encoder-Decoder Network for Weakly Supervised Action Recognition and Localization

Xiao-Yu Zhang, Changsheng Li, Haichao Shi, Xiaobin Zhu, Peng Li, Jing Dong

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.08548 2019-11-21 cs.CV 57%

Cross-Class Relevance Learning for Temporal Concept Localization

Junwei Ma, Satya Krishna Gorti, Maksims Volkovs, Ilya Stanevich, Guangwei Yu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.11228 2019-09-17 cs.CV 57%

Dilated Temporal Relational Adversarial Network for Generic Video Summarization

Yujia Zhang, Michael Kampffmeyer, Xiaodan Liang, Dingwen Zhang, Min Tan, Eric P. Xing

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.04289 2019-09-02 cs.CV 57%

SCSampler: Sampling Salient Clips from Video for Efficient Action Recognition

Bruno Korbar, Du Tran, Lorenzo Torresani

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11117 2019-08-02 cs.CV 57%

Learning Visual Actions Using Multiple Verb-Only Labels

Michael Wray, Dima Damen

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted at BMVC 2019. More information can be found at https://mwray.github.io/MVOL/. Annotations can be found at https://github.com/mwray/Multi-Verb-Labels

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.01524 2019-06-05 cs.CV cs.GR cs.LG 57%

Text-based Editing of Talking-head Video

Ohad Fried, Ayush Tewari, Michael Zollhöfer, Adam Finkelstein, Eli Shechtman, Dan B Goldman, Kyle Genova, Zeyu Jin, Christian Theobalt, Maneesh Agrawala

专题命中 视频理解 :video generation(abstract);分类 cs.CV

Comments A version with higher resolution images can be downloaded from the authors' website

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.10240 2019-06-05 cs.CV cs.AI cs.LG 57%

From Here to There: Video Inbetweening Using Direct 3D Convolutions

Yunpeng Li, Dominik Roblek, Marco Tagliasacchi

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.00377 2019-06-04 cs.CV 57%

Hierarchical Video Frame Sequence Representation with Deep Convolutional Graph Network

Feng Mao, Xiang Wu, Hui Xue, Rong Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ECCV 2018

Journal ref ECCV 2018 Workshops pp 262-270

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.08711 2019-05-22 cs.CV cs.AI cs.LG 57%

Lightweight Network Architecture for Real-Time Action Recognition

Alexander Kozlov, Vadim Andronov, Yana Gritsenko

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.05637 2019-05-08 cs.CV 57%

Dynamic Graph Modules for Modeling Object-Object Interactions in Activity Recognition

Hao Huang, Luowei Zhou, Wei Zhang, Jason J. Corso, Chenliang Xu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.00561 2019-05-03 cs.CV 57%

Large-scale weakly-supervised pre-training for video action recognition

Deepti Ghadiyaram, Matt Feiszli, Du Tran, Xueting Yan, Heng Wang, Dhruv Mahajan

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.01461 2019-04-05 cs.CV 57%

The Visual Centrifuge: Model-Free Layered Video Representations

Jean-Baptiste Alayrac, João Carreira, Andrew Zisserman

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Appears in: 2019 IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2019). This arXiv contains the CVPR Camera Ready version of the paper (although we have included larger figures) as well as an appendix detailing the model architecture

详情

展开后加载摘要…

URL PDF HTML 收藏