arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1390 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1390 篇

2112.01038 2021-12-03 cs.CV 57%

Stacked Temporal Attention: Improving First-person Action Recognition by Emphasizing Discriminative Clips

Lijin Yang, Yifei Huang, Yusuke Sugano, Yoichi Sato

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments BMVC 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.14785 2021-12-02 cs.CV cs.CL 57%

A Comprehensive Review of the Video-to-Text Problem

Jesus Perez-Martin, Benjamin Bustos, Silvio Jamil F. Guimarães, Ivan Sipiran, Jorge Pérez, Grethel Coello Said

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments 66 pages, 6 figures. Accepted by Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.13992 2021-10-28 cs.CV cs.LG 57%

Leveraging Local Temporal Information for Multimodal Scene Classification

Saurabh Sahu, Palash Goyal

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.13384 2021-10-27 cs.CV 57%

ViDA-MAN: Visual Dialog with Digital Humans

Tong Shen, Jiawei Zuo, Fan Shi, Jin Zhang, Liqin Jiang, Meng Chen, Zhengchen Zhang, Wei Zhang, Xiaodong He, Tao Mei

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.06615 2021-10-14 cs.CV 57%

CLIP4Caption: CLIP for Video Caption

Mingkang Tang, Zhanyu Wang, Zhenhua Liu, Fengyun Rao, Dian Li, Xiu Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.14503 2021-10-11 cs.CV 57%

End-to-End Video Instance Segmentation with Transformers

Yuqing Wang, Zhaoliang Xu, Xinlong Wang, Chunhua Shen, Baoshan Cheng, Hao Shen, Huaxia Xia

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR2021 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.01015 2021-10-05 cs.CV cs.AI cs.LG 57%

Spatio-Temporal Video Representation Learning for AI Based Video Playback Style Prediction

Rishubh Parihar, Gaurav Ramola, Ranajit Saha, Ravi Kini, Aniket Rege, Sudha Velusamy

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 10 pages, 5 figures, 4 tables, ICCV Workshops 2021 - SRVU

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11593 2021-09-27 cs.CV 57%

Long Short View Feature Decomposition via Contrastive Video Representation Learning

Nadine Behrmann, Mohsen Fayyaz, Juergen Gall, Mehdi Noroozi

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments ICCV 2021 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.00222 2021-09-02 cs.CV 57%

Spatio-Temporal Perturbations for Video Attribution

Zhenqiang Li, Weimin Wang, Zuoyue Li, Yifei Huang, Yoichi Sato

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02833 2021-08-20 cs.CV 57%

Elaborative Rehearsal for Zero-shot Action Recognition

Shizhe Chen, Dong Huang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02183 2021-08-18 cs.CV 57%

Enhancing Self-supervised Video Representation Learning via Multi-level Feature Optimization

Rui Qian, Yuxi Li, Huabin Liu, John See, Shuangrui Ding, Xian Liu, Dian Li, Weiyao Lin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02963 2021-07-28 cs.CV 57%

Disentangle Your Dense Object Detector

Zehui Chen, Chenhongyi Yang, Qiaofei Li, Feng Zhao, Zheng-Jun Zha, Feng Wu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ACM MM2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.06961 2021-07-01 cs.CV 57%

Tiny Video Networks

AJ Piergiovanni, Anelia Angelova, Michael S. Ryoo

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.14447 2021-06-29 cs.CV cs.AI cs.LG 57%

Feature Combination Meets Attention: Baidu Soccer Embeddings and Transformer based Temporal Detection

Xin Zhou, Le Kang, Zhiyu Cheng, Bo He, Jingyu Xin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Tech Report. Authors Xin Zhou, Le Kang, and Zhiyu Cheng made equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.11250 2021-06-22 cs.CV cs.AI cs.LG 57%

VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning

Hao Tan, Jie Lei, Thomas Wolf, Mohit Bansal

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Under review, 23 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03152 2021-06-16 cs.CV 57%

Technical Report: Temporal Aggregate Representations

Fadime Sener, Dibyadip Chatterjee, Angela Yao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.05058 2021-06-10 cs.CV 57%

Towards Training Stronger Video Vision Transformers for EPIC-KITCHENS-100 Action Recognition

Ziyuan Huang, Zhiwu Qing, Xiang Wang, Yutong Feng, Shiwei Zhang, Jianwen Jiang, Zhurong Xia, Mingqian Tang, Nong Sang, Marcelo H. Ang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPRW 2021, EPIC-KITCHENS-100 Competition Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03772 2021-06-08 cs.CV 57%

Learning Dynamics via Graph Neural Networks for Human Pose Estimation and Tracking

Yiding Yang, Zhou Ren, Haoxiang Li, Chunluan Zhou, Xinchao Wang, Gang Hua

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00451 2021-06-02 cs.CV cs.AI cs.CL 57%

Highlight Timestamp Detection Model for Comedy Videos via Multimodal Sentiment Analysis

Fan Huang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.04489 2021-05-11 cs.CV cs.CL cs.LG cs.SD eess.AS 57%

Spoken Moments: Learning Joint Audio-Visual Representations from Video Descriptions

Mathew Monfort, SouYoung Jin, Alexander Liu, David Harwath, Rogerio Feris, James Glass, Aude Oliva

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments To appear at CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.13400 2021-04-29 cs.CV cs.LG 57%

FrameExit: Conditional Early Exiting for Efficient Video Recognition

Amir Ghodrati, Babak Ehteshami Bejnordi, Amirhossein Habibian

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2021 | Oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10492 2021-04-22 cs.CV 57%

Skimming and Scanning for Untrimmed Video Action Recognition

Yunyan Hong, Ailing Zeng, Min Li, Cewu Lu, Li Jiang, Qiang Xu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.05970 2021-04-14 cs.CV 57%

Crossover Learning for Fast Online Video Instance Segmentation

Shusheng Yang, Yuxin Fang, Xinggang Wang, Yu Li, Chen Fang, Ying Shan, Bin Feng, Wenyu Liu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11272 2021-03-16 cs.CV 57%

A Novel Approach for Robust Multi Human Action Recognition and Summarization based on 3D Convolutional Neural Networks

Noor Almaadeed, Omar Elharrouss, Somaya Al-Maadeed, Ahmed Bouridane, Azeddine Beghdadi

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.09280 2021-01-18 cs.CV cs.LG 57%

Continuous Emotion Recognition with Spatiotemporal Convolutional Neural Networks

Thomas Teixeira, Eric Granger, Alessandro Lameiras Koerich

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.05061 2021-01-14 cs.CV cs.RO 57%

Understanding Action Sequences based on Video Captioning for Learning-from-Observation

Iori Yanokura, Naoki Wake, Kazuhiro Sasabuchi, Katsushi Ikeuchi, Masayuki Inaba

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13046 2020-11-30 cs.CV 57%

Can Temporal Information Help with Contrastive Self-Supervised Learning?

Yutong Bai, Haoqi Fan, Ishan Misra, Ganesh Venkatesh, Yongyi Lu, Yuyin Zhou, Qihang Yu, Vikas Chandra, Alan Yuille

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.09046 2020-11-25 cs.CV cs.CL 57%

A Hierarchical Multi-Modal Encoder for Moment Localization in Video Corpus

Bowen Zhang, Hexiang Hu, Joonseok Lee, Ming Zhao, Sheide Chammas, Vihan Jain, Eugene Ie, Fei Sha

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.14810 2020-10-29 cs.CV cs.LG 57%

Cycle-Contrast for Self-Supervised Video Representation Learning

Quan Kong, Wenpeng Wei, Ziwei Deng, Tomoaki Yoshinaga, Tomokazu Murakami

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.14338 2020-10-19 cs.CL cs.CV 57%

Beyond Instructional Videos: Probing for More Diverse Visual-Textual Grounding on YouTube

Jack Hessel, Zhenhai Zhu, Bo Pang, Radu Soricut

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 11 pages including supplementary materials

Journal ref Published in EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏