arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2212.14128 2023-01-02 cs.CV 57%

Joint Engagement Classification using Video Augmentation Techniques for Multi-person Human-robot Interaction

Yubin Kim, Huili Chen, Sharifa Alghowinem, Cynthia Breazeal, Hae Won Park

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06206 2022-12-20 cs.CV 57%

Contextual Explainable Video Representation: Human Perception-based Understanding

Khoa Vo, Kashu Yamazaki, Phong X. Nguyen, Phat Nguyen, Khoa Luu, Ngan Le

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted in Asilomar Conference 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00986 2022-12-06 cs.CV cs.AI cs.CL 57%

Masked Contrastive Pre-Training for Efficient Video-Text Retrieval

Fangxun Shu, Biaolong Chen, Yue Liao, Shuwen Xiao, Wenyu Sun, Xiaobo Li, Yousong Zhu, Jinqiao Wang, Si Liu

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06346 2022-11-30 cs.CV 57%

Bringing Image Scene Structure to Video via Frame-Clip Consistency of Object Tokens

Elad Ben-Avraham, Roei Herzig, Karttikeya Mangalam, Amir Bar, Anna Rohrbach, Leonid Karlinsky, Trevor Darrell, Amir Globerson

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12748 2022-11-28 cs.CV 57%

Dynamic Appearance: A Video Representation for Action Recognition with Joint Training

Guoxi Huang, Adrian G. Bors

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11210 2022-11-24 cs.CV cs.AI cs.IR 57%

Contrastive Masked Autoencoders for Self-Supervised Video Hashing

Yuting Wang, Jinpeng Wang, Bin Chen, Ziyun Zeng, Shutao Xia

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments This work is accepted by the AAAI 2023. 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.03873 2022-11-24 cs.CV cs.AI 57%

OperA: Attention-Regularized Transformers for Surgical Phase Recognition

Tobias Czempiel, Magdalini Paschali, Daniel Ostler, Seong Tae Kim, Benjamin Busam, Nassir Navab

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09552 2022-11-18 cs.CV 57%

UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer

Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Limin Wang, Yu Qiao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 24 pages, 4 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09529 2022-11-18 cs.CV 57%

InternVideo-Ego4D: A Pack of Champion Solutions to Ego4D Challenges

Guo Chen, Sen Xing, Zhe Chen, Yi Wang, Kunchang Li, Yizhuo Li, Yi Liu, Jiahao Wang, Yin-Dong Zheng, Bingkun Huang, Zhiyu Zhao, Junting Pan, Yifei Huang, Zun Wang, Jiashuo Yu, Yinan He, Hongjie Zhang, Tong Lu, Yali Wang, Limin Wang, Yu Qiao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical report in 2nd International Ego4D Workshop@ECCV 2022. Code will be released at https://github.com/OpenGVLab/ego4d-eccv2022-solutions

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08728 2022-11-17 cs.CV 57%

Exploring State Change Capture of Heterogeneous Backbones @ Ego4D Hands and Objects Challenge 2022

Yin-Dong Zheng, Guo Chen, Jiahao Wang, Tong Lu, Limin Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03162 2022-11-08 cs.CV 57%

Transformed ROIs for Capturing Visual Transformations in Videos

Abhinav Rai, Fadime Sener, Angela Yao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVIU 2022 - Computer Vision and Image Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.13326 2022-10-25 cs.CL cs.CV 57%

Clean Text and Full-Body Transformer: Microsoft's Submission to the WMT22 Shared Task on Sign Language Translation

Subhadeep Dey, Abhilash Pal, Cyrine Chaabani, Oscar Koller

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments accepted for publication at WMT2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10828 2022-10-21 cs.CV 57%

Grounded Video Situation Recognition

Zeeshan Khan, C. V. Jawahar, Makarand Tapaswi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2022. Project Page: https://zeeshank95.github.io/grvidsitu

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10039 2022-10-19 cs.CV cs.CY cs.LG 57%

How Would The Viewer Feel? Estimating Wellbeing From Video Scenarios

Mantas Mazeika, Eric Tang, Andy Zou, Steven Basart, Jun Shern Chan, Dawn Song, David Forsyth, Jacob Steinhardt, Dan Hendrycks

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments NeurIPS 2022; datasets available at https://github.com/hendrycks/emodiversity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.10394 2022-10-11 cs.CV 57%

Capturing Temporal Information in a Single Frame: Channel Sampling Strategies for Action Recognition

Kiyoon Kim, Shreyank N Gowda, Oisin Mac Aodha, Laura Sevilla-Lara

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments BMVC 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02365 2022-10-06 cs.CV 57%

SoccerNet 2022 Challenges Results

Silvio Giancola, Anthony Cioppa, Adrien Deliège, Floriane Magera, Vladimir Somers, Le Kang, Xin Zhou, Olivier Barnich, Christophe De Vleeschouwer, Alexandre Alahi, Bernard Ghanem, Marc Van Droogenbroeck, Abdulrahman Darwish, Adrien Maglo, Albert Clapés, Andreas Luyts, Andrei Boiarov, Artur Xarles, Astrid Orcesi, Avijit Shah, Baoyu Fan, Bharath Comandur, Chen Chen, Chen Zhang, Chen Zhao, Chengzhi Lin, Cheuk-Yiu Chan, Chun Chuen Hui, Dengjie Li, Fan Yang, Fan Liang, Fang Da, Feng Yan, Fufu Yu, Guanshuo Wang, H. Anthony Chan, He Zhu, Hongwei Kan, Jiaming Chu, Jianming Hu, Jianyang Gu, Jin Chen, João V. B. Soares, Jonas Theiner, Jorge De Corte, José Henrique Brito, Jun Zhang, Junjie Li, Junwei Liang, Leqi Shen, Lin Ma, Lingchi Chen, Miguel Santos Marques, Mike Azatov, Nikita Kasatkin, Ning Wang, Qiong Jia, Quoc Cuong Pham, Ralph Ewerth, Ran Song, Rengang Li, Rikke Gade, Ruben Debien, Runze Zhang, Sangrok Lee, Sergio Escalera, Shan Jiang, Shigeyuki Odashima, Shimin Chen, Shoichi Masui, Shouhong Ding, Sin-wai Chan, Siyu Chen, Tallal El-Shabrawy, Tao He, Thomas B. Moeslund, Wan-Chi Siu, Wei Zhang, Wei Li, Xiangwei Wang, Xiao Tan, Xiaochuan Li, Xiaolin Wei, Xiaoqing Ye, Xing Liu, Xinying Wang, Yandong Guo, Yaqian Zhao, Yi Yu, Yingying Li, Yue He, Yujie Zhong, Zhenhua Guo, Zhiheng Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at ACM MMSports 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.00307 2022-10-06 cs.CV 57%

Temporal Perceiver: A General Architecture for Arbitrary Boundary Detection

Jing Tan, Yuhong Wang, Gangshan Wu, Limin Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.08956 2022-09-20 cs.CV 57%

Panoramic Vision Transformer for Saliency Detection in 360° Videos

Heeseung Yun, Sehun Lee, Gunhee Kim

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Published to ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04242 2022-09-12 cs.CV 57%

EchoCoTr: Estimation of the Left Ventricular Ejection Fraction from Spatiotemporal Echocardiography

Rand Muhtaseb, Mohammad Yaqub

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11307 2022-09-02 cs.CV cs.AI cs.CL 57%

Visual Subtitle Feature Enhanced Video Outline Generation

Qi Lv, Ziqiang Cao, Wenrui Xie, Derui Wang, Jingwen Wang, Zhiwei Hu, Tangkun Zhang, Ba Yuan, Yuanhang Li, Min Cao, Wenjie Li, Sujian Li, Guohong Fu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.07925 2022-08-30 cs.CV 57%

ActionFormer: Localizing Moments of Actions with Transformers

Chenlin Zhang, Jianxin Wu, Yin Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.06105 2022-08-15 cs.CV 57%

Motion Sensitive Contrastive Learning for Self-supervised Video Representation

Jingcheng Ni, Nan Zhou, Jie Qin, Qian Wu, Junqi Liu, Boxun Li, Di Huang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by ECCV2022, 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05375 2022-08-11 cs.CV cs.AI 57%

Exploring Anchor-based Detection for Ego4D Natural Language Query

Sipeng Zheng, Qi Zhang, Bei Liu, Qin Jin, Jianlong Fu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2022 Ego4D Workshop NLQ Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.12795 2022-07-27 cs.CV cs.LG 57%

Static and Dynamic Concepts for Self-supervised Video Representation Learning

Rui Qian, Shuangrui Ding, Xian Liu, Dahua Lin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01375 2022-07-21 cs.CV cs.AI 57%

GraphVid: It Only Takes a Few Nodes to Understand a Video

Eitan Kosman, Dotan Di Castro

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ECCV2022 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08001 2022-07-19 cs.CV 57%

SVGraph: Learning Semantic Graphs from Instructional Videos

Madeline C. Schiappa, Yogesh S. Rawat

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 20 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06261 2022-07-14 cs.CV cs.LG 57%

Is Appearance Free Action Recognition Possible?

Filip Ilic, Thomas Pock, Richard P. Wildes

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.07624 2022-07-06 cs.CV 57%

Attention Mechanisms in Computer Vision: A Survey

Meng-Hao Guo, Tian-Xing Xu, Jiang-Jiang Liu, Zheng-Ning Liu, Peng-Tao Jiang, Tai-Jiang Mu, Song-Hai Zhang, Ralph R. Martin, Ming-Ming Cheng, Shi-Min Hu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 27 pages, 9 figures

Journal ref Computational Visual Media, 2022, Vol. 8, No. 3, 331-368

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.14555 2022-06-30 cs.CV cs.AI 57%

Technical Report for CVPR 2022 LOVEU AQTC Challenge

Hyeonyu Kim, Jongeun Kim, Jeonghun Kang, Sanguk Park, Dongchan Park, Taehwan Kim

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 4 pages, 3 figures, technical report for track3 of CVPR 2022 LOVEU challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.13478 2022-06-30 cs.CV 57%

Video Joint Modelling Based on Hierarchical Transformer for Co-summarization

Li Haopeng, Ke Qiuhong, Gong Mingming, Zhang Rui

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏