arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1390 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1390 篇

2010.03019 2020-10-15 cs.CV cs.LG 57%

Global Self-Attention Networks for Image Recognition

Zhuoran Shen, Irwan Bello, Raviteja Vemulapalli, Xuhui Jia, Ching-Hui Chen

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.06430 2020-08-25 cs.CV 57%

End-to-End Learning of Visual Representations from Uncurated Instructional Videos

Antoine Miech, Jean-Baptiste Alayrac, Lucas Smaira, Ivan Laptev, Josef Sivic, Andrew Zisserman

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments CVPR'2020 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.01057 2020-08-04 cs.CV 57%

Residual Frames with Efficient Pseudo-3D CNN for Human Action Recognition

Jiawei Chen, Jenson Hsiao, Chiu Man Ho

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.00936 2020-08-04 cs.CV 57%

Detection and Localization of Robotic Tools in Robot-Assisted Surgery Videos Using Deep Neural Networks for Region Proposal and Detection

Duygu Sarikaya, Jason J. Corso, Khurshid A. Guru

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Journal ref IEEE Transactions on Medical Imaging 36 (2017) 1542-1549

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.00998 2020-06-11 cs.CV 57%

A Multigrid Method for Efficiently Training Video Models

Chao-Yuan Wu, Ross Girshick, Kaiming He, Christoph Feichtenhofer, Philipp Krähenbühl

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13209 2020-05-28 cs.CV cs.LG cs.NE 57%

AssembleNet: Searching for Multi-Stream Neural Connectivity in Video Architectures

Michael S. Ryoo, AJ Piergiovanni, Mingxing Tan, Anelia Angelova

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Journal ref ICLR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.09260 2020-05-22 cs.CV cs.RO 57%

4D Generic Video Object Proposals

Aljosa Osep, Paul Voigtlaender, Mark Weber, Jonathon Luiten, Bastian Leibe

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ICRA 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.08206 2020-04-23 cs.CV 57%

Mimic The Raw Domain: Accelerating Action Recognition in the Compressed Domain

Barak Battash, Haim Barad, Hanlin Tang, Amit Bleiweiss

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2020: Joint Workshop on Efficient Deep Learning in Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.09087 2020-03-23 cs.CV 57%

Fully Automated Hand Hygiene Monitoring\\in Operating Room using 3D Convolutional Neural Network

Minjee Kim, Joonmyeong Choi, Namkug Kim

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.05614 2020-03-13 cs.CV 57%

Beyond the Camera: Neural Networks in World Coordinates

Gunnar A. Sigurdsson, Abhinav Gupta, Cordelia Schmid, Karteek Alahari

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.01442 2020-03-10 cs.CV cs.AI cs.CL cs.LG 57%

CLEVRER: CoLlision Events for Video REpresentation and Reasoning

Kexin Yi, Chuang Gan, Yunzhu Li, Pushmeet Kohli, Jiajun Wu, Antonio Torralba, Joshua B. Tenenbaum

专题命中 视频理解 :video reasoning(abstract);分类 cs.CV

Comments The first two authors contributed equally to this work. Accepted as Oral Spotlight as ICLR 2020. Project page: http://clevrer.csail.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.03152 2020-02-11 cs.CV 57%

CTM: Collaborative Temporal Modeling for Action Recognition

Qian Liu, Tao Wang, Jie Liu, Yang Guan, Qi Bu, Longfei Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.06680 2020-01-22 cs.CV 57%

Tree-Structured Policy based Progressive Reinforcement Learning for Temporally Language Grounding in Video

Jie Wu, Guanbin Li, Si Liu, Liang Lin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments To appear in AAAI2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11961 2019-11-28 cs.CV 57%

AdapNet: Adaptability Decomposing Encoder-Decoder Network for Weakly Supervised Action Recognition and Localization

Xiao-Yu Zhang, Changsheng Li, Haichao Shi, Xiaobin Zhu, Peng Li, Jing Dong

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.08548 2019-11-21 cs.CV 57%

Cross-Class Relevance Learning for Temporal Concept Localization

Junwei Ma, Satya Krishna Gorti, Maksims Volkovs, Ilya Stanevich, Guangwei Yu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.11228 2019-09-17 cs.CV 57%

Dilated Temporal Relational Adversarial Network for Generic Video Summarization

Yujia Zhang, Michael Kampffmeyer, Xiaodan Liang, Dingwen Zhang, Min Tan, Eric P. Xing

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.04289 2019-09-02 cs.CV 57%

SCSampler: Sampling Salient Clips from Video for Efficient Action Recognition

Bruno Korbar, Du Tran, Lorenzo Torresani

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11117 2019-08-02 cs.CV 57%

Learning Visual Actions Using Multiple Verb-Only Labels

Michael Wray, Dima Damen

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted at BMVC 2019. More information can be found at https://mwray.github.io/MVOL/. Annotations can be found at https://github.com/mwray/Multi-Verb-Labels

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.01524 2019-06-05 cs.CV cs.GR cs.LG 57%

Text-based Editing of Talking-head Video

Ohad Fried, Ayush Tewari, Michael Zollhöfer, Adam Finkelstein, Eli Shechtman, Dan B Goldman, Kyle Genova, Zeyu Jin, Christian Theobalt, Maneesh Agrawala

专题命中 视频理解 :video generation(abstract);分类 cs.CV

Comments A version with higher resolution images can be downloaded from the authors' website

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.10240 2019-06-05 cs.CV cs.AI cs.LG 57%

From Here to There: Video Inbetweening Using Direct 3D Convolutions

Yunpeng Li, Dominik Roblek, Marco Tagliasacchi

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.00377 2019-06-04 cs.CV 57%

Hierarchical Video Frame Sequence Representation with Deep Convolutional Graph Network

Feng Mao, Xiang Wu, Hui Xue, Rong Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ECCV 2018

Journal ref ECCV 2018 Workshops pp 262-270

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.08711 2019-05-22 cs.CV cs.AI cs.LG 57%

Lightweight Network Architecture for Real-Time Action Recognition

Alexander Kozlov, Vadim Andronov, Yana Gritsenko

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.05637 2019-05-08 cs.CV 57%

Dynamic Graph Modules for Modeling Object-Object Interactions in Activity Recognition

Hao Huang, Luowei Zhou, Wei Zhang, Jason J. Corso, Chenliang Xu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.00561 2019-05-03 cs.CV 57%

Large-scale weakly-supervised pre-training for video action recognition

Deepti Ghadiyaram, Matt Feiszli, Du Tran, Xueting Yan, Heng Wang, Dhruv Mahajan

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.01461 2019-04-05 cs.CV 57%

The Visual Centrifuge: Model-Free Layered Video Representations

Jean-Baptiste Alayrac, João Carreira, Andrew Zisserman

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Appears in: 2019 IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2019). This arXiv contains the CVPR Camera Ready version of the paper (although we have included larger figures) as well as an appendix detailing the model architecture

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.11387 2019-04-05 cs.CV 57%

Self-Supervised Spatiotemporal Feature Learning via Video Rotation Prediction

Longlong Jing, Xiaodong Yang, Jingen Liu, Yingli Tian

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00110 2019-03-04 cs.CV 57%

Video Summarization via Actionness Ranking

Mohamed Elfeki, Ali Borji

专题命中 视频理解 :long video(abstract);分类 cs.CV

Journal ref Published in WACV-2019 as an Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.08854 2018-12-31 cs.CV cs.LG 57%

A Framework towards Domain Specific Video Summarization

Vishal Kaushal, Sandeep Subramanian, Suraj Kothawade, Rishabh Iyer, Ganesh Ramakrishnan

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments Accepted to WACV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.02872 2018-12-10 cs.CV 57%

An Attempt towards Interpretable Audio-Visual Video Captioning

Yapeng Tian, Chenxiao Guan, Justin Goodman, Marc Moore, Chenliang Xu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.11167 2018-11-28 cs.CV 57%

Integrated Object Detection and Tracking with Tracklet-Conditioned Detection

Zheng Zhang, Dazhi Cheng, Xizhou Zhu, Stephen Lin, Jifeng Dai

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏