arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2305.03517 2023-06-06 cs.CL cs.AI 62%

Few-shot Domain-Adaptive Visually-fused Event Detection from Text

Farhad Moghimifar, Fatemeh Shiri, Van Nguyen, Reza Haffari, Yuan-Fang Li

专题命中 视频多模态 :image-text(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.10918 2023-06-01 cs.CV cs.CL cs.IR 62%

CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding

Zhijian Hou, Wanjun Zhong, Lei Ji, Difei Gao, Kun Yan, Wing-Kwong Chan, Chong-Wah Ngo, Zheng Shou, Nan Duan

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments ACL 2023 Camera Ready. 14 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12218 2023-05-23 cs.CV cs.AI cs.IR 62%

Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set Alignment

Peng Jin, Hao Li, Zesen Cheng, Jinfa Huang, Zhennan Wang, Li Yuan, Chang Liu, Jie Chen

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03204 2023-05-08 cs.CV cs.CL 62%

VideoOFA: Two-Stage Pre-Training for Video-to-Text Generation

Xilun Chen, Lili Yu, Wenhan Xiong, Barlas Oğuz, Yashar Mehdad, Wen-tau Yih

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13143 2023-04-27 cs.AI cs.CV cs.LG 62%

Self-Supervised Temporal Analysis of Spatiotemporal Data

Yi Cao, Swetava Ganguli, Vipul Pandey

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted for oral presentation at the 43rd IEEE International Geoscience and Remote Sensing Symposium (IGARSS), 2023, Pasadena, California. 4 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.12561 2023-04-26 cs.CV cs.MM 62%

TCR: Short Video Title Generation and Cover Selection with Attention Refinement

Yakun Yu, Jiuding Yang, Weidong Guo, Hui Liu, Yu Xu, Di Niu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepted by PAKDD23

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09751 2023-04-20 cs.CV cs.AI cs.LG 62%

Skeleton-based action analysis for ADHD diagnosis

Yichun Li, Yi Li, Rajesh Nair, Syed Mohsen Naqvi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05038 2023-04-20 cs.CL cs.CV 62%

Fighting FIRe with FIRE: Assessing the Validity of Text-to-Video Retrieval Benchmarks

Pedro Rodriguez, Mahmoud Azab, Becka Silvert, Renato Sanchez, Linzy Labson, Hardik Shah, Seungwhan Moon

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments EACL 2023 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05711 2023-04-06 cs.CV cs.CL cs.LG 62%

Synopses of Movie Narratives: a Video-Language Dataset for Story Understanding

Yidan Sun, Qin Chao, Yangfeng Ji, Boyang Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13916 2023-03-31 cs.CV cs.AI cs.LG 62%

Towards Good Practices for Missing Modality Robust Action Recognition

Sangmin Woo, Sumin Lee, Yeonju Park, Muhammad Adi Nugroho, Changick Kim

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments AAAI 2023 (Oral); Code: https://github.com/sangminwoo/ActionMAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05093 2023-03-10 cs.CV cs.CL 62%

Improving Video Retrieval by Adaptive Margin

Feng He, Qi Wang, Zhifan Feng, Wenbin Jiang, Yajuan Lv, Yong zhu, Xiao Tan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by SIGIR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03353 2023-02-23 cs.CL cs.AI cs.NE cs.RO 62%

Learning Bidirectional Action-Language Translation with Limited Supervision and Incongruent Input

Ozan Özdemir, Matthias Kerzel, Cornelius Weber, Jae Hee Lee, Muhammad Burhan Hafez, Patrick Bruns, Stefan Wermter

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Published in: Applied Artificial Intelligence, 37:1, 2179167

Journal ref Applied Artificial Intelligence Volume 37, 2023 - Issue 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.11507 2023-01-30 cs.CV cs.CL cs.LG 62%

Semi-Parametric Video-Grounded Text Generation

Sungdong Kim, Jin-Hwa Kim, Jiyoung Lee, Minjoon Seo

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Preprint (16 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07463 2023-01-19 cs.CV cs.AI 62%

Temporal Perceiving Video-Language Pre-training

Fan Ma, Xiaojie Jin, Heng Wang, Jingjia Huang, Linchao Zhu, Jiashi Feng, Yi Yang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02226 2022-12-06 q-bio.NC cs.AI cs.CV cs.LG 62%

Inferring latent neural sources via deep transcoding of simultaneously acquired EEG and fMRI

Xueqing Liu, Tao Tu, Paul Sajda

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11359 2022-11-22 cs.CL cs.AI cs.LG 62%

Challenges and Applications of Automated Extraction of Socio-political Events from Text (CASE 2022): Workshop and Shared Task Report

Ali Hürriyetoğlu, Hristo Tanev, Vanni Zavarella, Reyyan Yeniterzi, Osman Mutlu, Erdem Yörük

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments to appear at CASE 2022 @ EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12686 2022-11-21 cs.CV cs.AI 62%

Holistic Interaction Transformer Network for Action Detection

Gueter Josmy Faure, Min-Hung Chen, Shang-Hong Lai

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted for WACV 2023. Code: https://github.com/joslefaure/HIT

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.14198 2022-11-17 cs.CV cs.AI cs.LG 62%

Flamingo: a Visual Language Model for Few-Shot Learning

Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katie Millican, Malcolm Reynolds, Roman Ring, Eliza Rutherford, Serkan Cabi, Tengda Han, Zhitao Gong, Sina Samangooei, Marianne Monteiro, Jacob Menick, Sebastian Borgeaud, Andrew Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, Karen Simonyan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 54 pages. In Proceedings of Neural Information Processing Systems (NeurIPS) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.04947 2022-10-27 cs.CV cs.SD eess.AS 62%

OWL (Observe, Watch, Listen): Audiovisual Temporal Context for Localizing Actions in Egocentric Videos

Merey Ramazanova, Victor Escorcia, Fabian Caba Heilbron, Chen Zhao, Bernard Ghanem

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10820 2022-10-21 cs.CV cs.CL cs.IR cs.LG 62%

VTC: Improving Video-Text Retrieval with User Comments

Laura Hanu, James Thewlis, Yuki M. Asano, Christian Rupprecht

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted paper at the European Conference on Computer Vision (ECCV) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07503 2022-10-17 cs.CV cs.AI 62%

STAR-Transformer: A Spatio-temporal Cross Attention Transformer for Human Action Recognition

Dasom Ahn, Sangwon Kim, Hyunsu Hong, Byoung Chul Ko

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by WACV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06881 2022-10-14 cs.CV cs.AI 62%

RaP: Redundancy-aware Video-language Pre-training for Text-Video Retrieval

Xing Wu, Chaochen Gao, Zijia Lin, Zhongyuan Wang, Jizhong Han, Songlin Hu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11251 2022-10-13 cs.LG cs.AI cs.CV cs.RO 62%

Behavior Transformers: Cloning $k$ modes with one stone

Nur Muhammad Mahi Shafiullah, Zichen Jeff Cui, Ariuntuya Altanzaya, Lerrel Pinto

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Code and data available at https://github.com/notmahi/bet

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08155 2022-10-11 cs.CV cs.CL cs.LG 62%

Zero-Shot Video Question Answering via Frozen Bidirectional Language Models

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2022 Camera-Ready; Project Webpage: https://antoyang.github.io/frozenbilm.html; 25 pages; 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02946 2022-10-07 cs.IR cs.AI cs.LG cs.MM 62%

VLSNR:Vision-Linguistics Coordination Time Sequence-aware News Recommendation

Songhao Han, Wei Huang, Xiaotian Luan

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI、cs.MM

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14364 2022-09-30 cs.CV cs.AI 62%

Semantic Segmentation of Vegetation in Remote Sensing Imagery Using Deep Learning

Alexandru Munteanu, Marian Neagul

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Masters thesis presented in 2021 at the West University of Timisoara, faculty of Mathematics and Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13307 2022-09-28 cs.CV cs.CL cs.IR 62%

Text-Adaptive Multiple Visual Prototype Matching for Video-Text Retrieval

Chengzhi Lin, Ancong Wu, Junwei Liang, Jun Zhang, Wenhang Ge, Wei-Shi Zheng, Chunhua Shen

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments NIPS2022

Journal ref NIPS2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09019 2022-09-20 cs.CV cs.CL cs.LG 62%

LAVIS: A Library for Language-Vision Intelligence

Dongxu Li, Junnan Li, Hung Le, Guangsen Wang, Silvio Savarese, Steven C. H. Hoi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Preprint of LAVIS technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13479 2022-07-28 cs.CV cs.MM 62%

AutoTransition: Learning to Recommend Video Transition Effects

Yaojie Shen, Libo Zhang, Kai Xu, Xiaojie Jin

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments To appear at ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.05610 2022-07-22 cs.CV cs.CL 62%

CLIP2TV: Align, Match and Distill for Video-Text Retrieval

Zijian Gao, Jingyu Liu, Weiqi Sun, Sheng Chen, Dedan Chang, Lili Zhao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏