arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2008.10238 2023-10-10 cs.CV 70%

VLANet: Video-Language Alignment Network for Weakly-Supervised Video Moment Retrieval

Minuk Ma, Sunjae Yoon, Junyeong Kim, Youngjoon Lee, Sunghun Kang, Chang D. Yoo

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 16 pages, 6 figures, European Conference on Computer Vision, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00536 2023-09-19 cs.CV 70%

Bidirectional Correlation-Driven Inter-Frame Interaction Transformer for Referring Video Object Segmentation

Meng Lan, Fu Rong, Zuchao Li, Wei Yu, Lefei Zhang

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03990 2023-07-11 cs.CV 70%

FTFDNet: Learning to Detect Talking Face Video Manipulation with Tri-Modality Interaction

Ganglai Wang, Peng Zhang, Junwen Xiong, Feihan Yang, Wei Huang, Yufei Zha

专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2203.05178

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11732 2023-06-21 cs.CV 70%

Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models

Junting Pan, Ziyi Lin, Yuying Ge, Xiatian Zhu, Renrui Zhang, Yi Wang, Yu Qiao, Hongsheng Li

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17011 2023-05-29 cs.CV 70%

SOC: Semantic-Assisted Object Cluster for Referring Video Object Segmentation

Zhuoyan Luo, Yicheng Xiao, Yong Liu, Shuyan Li, Yitong Wang, Yansong Tang, Xiu Li, Yujiu Yang

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13167 2023-05-23 cs.CV 70%

VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending

Xingjian He, Sihan Chen, Fan Ma, Zhicheng Huang, Xiaojie Jin, Zikang Liu, Dongmei Fu, Yi Yang, Jing Liu, Jiashi Feng

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04824 2023-05-09 cs.CL 70%

Learning Summary-Worthy Visual Representation for Abstractive Summarization in Video

Zenan Xu, Xiaojun Meng, Yasheng Wang, Qinliang Su, Zexuan Qiu, Xin Jiang, Qun Liu

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL

Comments Accepted by IJCAI-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.08071 2023-04-26 cs.CV cs.AI cs.CL cs.MM 70%

Temporal Sentence Grounding in Videos: A Survey and Future Directions

Hao Zhang, Aixin Sun, Wei Jing, Joey Tianyi Zhou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12444 2023-02-27 cs.CV cs.AI cs.CL cs.MM 70%

Weakly-Supervised Temporal Article Grounding

Long Chen, Yulei Niu, Brian Chen, Xudong Lin, Guangxing Han, Christopher Thomas, Hammad Ayyubi, Heng Ji, Shih-Fu Chang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2022, https://github.com/zjuchenlong/WSAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10813 2023-02-22 cs.CV 70%

Tracking Objects and Activities with Attention for Temporal Sentence Grounding

Zeyu Xiong, Daizong Liu, Pan Zhou, Jiahao Zhu

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments accepted by ICASSP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13163 2022-12-29 cs.CV 70%

MRTNet: Multi-Resolution Temporal Network for Video Sentence Grounding

Wei Ji, Long Chen, Yinwei Wei, Yiming Wu, Tat-Seng Chua

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10936 2022-12-05 cs.CV cs.AI cs.CL cs.CR cs.MM 70%

Watch Those Words: Video Falsification Detection Using Word-Conditioned Facial Motion

Shruti Agarwal, Liwen Hu, Evonne Ng, Trevor Darrell, Hao Li, Anna Rohrbach

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted in WACV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13306 2022-12-02 cs.CV 70%

Embracing Consistency: A One-Stage Approach for Spatio-Temporal Video Grounding

Yang Jin, Yongzhi Li, Zehuan Yuan, Yadong Mu

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 18 pages, 7 figures, Accepted by Neurips 2022, Spotlight Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05060 2022-10-12 cs.CV 70%

AVE-CLIP: AudioCLIP-based Multi-window Temporal Transformer for Audio Visual Event Localization

Tanvir Mahmud, Diana Marculescu

专题命中 视频多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV

Comments Accepted in IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2023 (10 Pages, 5 Figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02578 2022-10-07 cs.CV 70%

AOE-Net: Entities Interactions Modeling with Adaptive Attention Mechanism for Temporal Action Proposals Generation

Khoa Vo, Sang Truong, Kashu Yamazaki, Bhiksha Raj, Minh-Triet Tran, Ngan Le

专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted for publication in International Journal of Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04215 2022-08-10 cs.CV 70%

Boosting Video-Text Retrieval with Explicit High-Level Semantics

Haoran Wang, Di Xu, Dongliang He, Fu Li, Zhong Ji, Jungong Han, Errui Ding

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by ACMMM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13457 2022-07-28 cs.CV 70%

Reducing the Vision and Language Bias for Temporal Sentence Grounding

Daizong Liu, Xiaoye Qu, Wei Hu

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments Accepted by ACM MM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08001 2022-07-19 cs.CV 70%

SVGraph: Learning Semantic Graphs from Instructional Videos

Madeline C. Schiappa, Yogesh S. Rawat

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 20 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.05580 2022-07-13 cs.CV 70%

Online Video Instance Segmentation via Robust Context Fusion

Xiang Li, Jinglu Wang, Xiaohao Xu, Bhiksha Raj, Yan Lu

专题命中 视频多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06060 2022-07-12 cs.CV 70%

Depth-Cooperated Trimodal Network for Video Salient Object Detection

Yukang Lu, Dingyao Min, Keren Fu, Qijun Zhao

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 5 pages, 3 figures, Accepted at ICIP-2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07160 2022-06-16 cs.CV 70%

LAVENDER: Unifying Video-Language Understanding as Masked Language Modeling

Linjie Li, Zhe Gan, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Ce Liu, Lijuan Wang

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.08949 2022-02-01 cs.CV 70%

Temporal Aggregation for Adaptive RGBT Tracking

Zhangyong Tang, Tianyang Xu, Xiao-Jun Wu

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.00454 2022-01-04 cs.CV 70%

Memory-Guided Semantic Learning Network for Temporal Sentence Grounding

Daizong Liu, Xiaoye Qu, Xing Di, Yu Cheng, Zichuan Xu, Pan Zhou

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by AAAI2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.09583 2021-12-24 cs.CV 70%

Align and Prompt: Video-and-Language Pre-training with Entity Prompts

Dongxu Li, Junnan Li, Hongdong Li, Juan Carlos Niebles, Steven C. H. Hoi

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08472 2021-09-20 cs.CV 70%

ActionCLIP: A New Paradigm for Video Action Recognition

Mengmeng Wang, Jiazheng Xing, Yong Liu

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.01534 2021-06-04 cs.CV 70%

Deconfounded Video Moment Retrieval with Causal Intervention

Xun Yang, Fuli Feng, Wei Ji, Meng Wang, Tat-Seng Chua

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments This work has been accepted by SIGIR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08860 2021-05-11 cs.CV 70%

CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval

Huaishao Luo, Lei Ji, Ming Zhong, Yang Chen, Wen Lei, Nan Duan, Tianrui Li

专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.12134 2021-04-19 cs.CV 70%

Siamese Network for RGB-D Salient Object Detection and Beyond

Keren Fu, Deng-Ping Fan, Ge-Peng Ji, Qijun Zhao, Jianbing Shen, Ce Zhu

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2004.08515

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.00936 2020-08-04 cs.CV 70%

Detection and Localization of Robotic Tools in Robot-Assisted Surgery Videos Using Deep Neural Networks for Region Proposal and Detection

Duygu Sarikaya, Jason J. Corso, Khurshid A. Guru

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Journal ref IEEE Transactions on Medical Imaging 36 (2017) 1542-1549

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.14164 2020-07-29 cs.CV 70%

Learning Modality Interaction for Temporal Sentence Localization and Event Captioning in Videos

Shaoxiang Chen, Wenhao Jiang, Wei Liu, Yu-Gang Jiang

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏