arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2312.06330 2023-12-12 cs.CV cs.AI cs.RO eess.IV 62%

Navigating Open Set Scenarios for Skeleton-based Action Recognition

Kunyu Peng, Cheng Yin, Junwei Zheng, Ruiping Liu, David Schneider, Jiaming Zhang, Kailun Yang, M. Saquib Sarfraz, Rainer Stiefelhagen, Alina Roitberg

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to AAAI 2024. The benchmark, code, and models will be released at https://github.com/KPeng9510/OS-SAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12919 2023-12-05 cs.CV cs.AI 62%

SPOT! Revisiting Video-Language Models for Event Understanding

Gengyuan Zhang, Jinhe Bi, Jindong Gu, Yanyu Chen, Volker Tresp

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13925 2023-12-05 cs.CV cs.AI 62%

Towards Surveillance Video-and-Language Understanding: New Dataset, Baselines, and Challenges

Tongtong Yuan, Xuange Zhang, Kun Liu, Bo Liu, Chen Chen, Jian Jin, Zhenzhen Jiao

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18241 2023-12-01 cs.CV cs.AI 62%

LLVMs4Protest: Harnessing the Power of Large Language and Vision Models for Deciphering Protests in the News

Yongjun Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04512 2023-11-09 cs.CV cs.AI 62%

FFINet: Future Feedback Interaction Network for Motion Forecasting

Miao Kang, Shengqi Wang, Sanping Zhou, Ke Ye, Jingjing Jiang, Nanning Zheng

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02863 2023-11-07 cs.CV cs.AI 62%

Temporal Shift -- Multi-Objective Loss Function for Improved Anomaly Fall Detection

Stefan Denkovski, Shehroz S. Khan, Alex Mihailidis

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01233 2023-11-03 cs.CV cs.AI 62%

Long Story Short: a Summarize-then-Search Method for Long Video Question Answering

Jiwan Chung, Youngjae Yu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Published in BMVC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16402 2023-10-26 cs.CV cs.CL 62%

Video Referring Expression Comprehension via Transformer with Content-conditioned Query

Ji Jiang, Meng Cao, Tengtao Song, Long Chen, Yi Wang, Yuexian Zou

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted to ACM International Conference on Multimedia Workshop (ACM MM), 2023. arXiv admin note: substantial text overlap with arXiv:2210.02953

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10683 2023-10-24 cs.CV cs.CL 62%

Paxion: Patching Action Knowledge in Video-Language Foundation Models

Zhenhailong Wang, Ansel Blume, Sha Li, Genglin Liu, Jaemin Cho, Zineng Tang, Mohit Bansal, Heng Ji

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2023 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05765 2023-10-10 cs.CL cs.CV 62%

Information-Theoretic Text Hallucination Reduction for Video-grounded Dialogue

Sunjae Yoon, Eunseop Yoon, Hee Suk Yoon, Junyeong Kim, Chang D. Yoo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments 12 pages, Accepted in EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05423 2023-09-27 cs.CV cs.CL 62%

Learning to Locate Visual Answer in Video Corpus Using Question

Bin Li, Yixuan Weng, Bin Sun, Shutao Li

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.03335 2023-09-19 cs.CL cs.AI cs.IR cs.LG 62%

DeepKE: A Deep Learning Based Knowledge Extraction Toolkit for Knowledge Base Population

Ningyu Zhang, Xin Xu, Liankuan Tao, Haiyang Yu, Hongbin Ye, Shuofei Qiao, Xin Xie, Xiang Chen, Zhoubo Li, Lei Li, Xiaozhuan Liang, Yunzhi Yao, Shumin Deng, Peng Wang, Wen Zhang, Zhenru Zhang, Chuanqi Tan, Qiang Chen, Feiyu Xiong, Fei Huang, Guozhou Zheng, Huajun Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2022 System Demonstrations and the project website is http://deepke.zjukg.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09179 2023-08-29 cs.CV cs.AI 62%

Pretrained Language Models as Visual Planners for Human Assistance

Dhruvesh Patel, Hamid Eghbalzadeh, Nitin Kamra, Michael Louis Iuzzolino, Unnat Jain, Ruta Desai

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12049 2023-08-24 cs.CV cs.AI 62%

Towards Privacy-Supporting Fall Detection via Deep Unsupervised RGB2Depth Adaptation

Hejun Xiao, Kunyu Peng, Xiangsheng Huang, Alina Roitberg1, Hao Li, Zhaohui Wang, Rainer Stiefelhagen

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11093 2023-08-23 cs.CV cs.AI cs.LG 62%

Video OWL-ViT: Temporally-consistent open-world localization in video

Georg Heigold, Matthias Minderer, Alexey Gritsenko, Alex Bewley, Daniel Keysers, Mario Lučić, Fisher Yu, Thomas Kipf

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06897 2023-08-15 cs.CV cs.MM 62%

Orthogonal Temporal Interpolation for Zero-Shot Video Recognition

Yan Zhu, Junbao Zhuo, Bin Ma, Jiajia Geng, Xiaoming Wei, Xiaolin Wei, Shuhui Wang

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.MM

Journal ref Proceedings of the 31st ACM International Conference on Multimedia (MM '23), October 29-November 3, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06571 2023-08-15 cs.CV cs.AI 62%

ModelScope Text-to-Video Technical Report

Jiuniu Wang, Hangjie Yuan, Dayou Chen, Yingya Zhang, Xiang Wang, Shiwei Zhang

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Technical report. Project page: \url{https://modelscope.cn/models/damo/text-to-video-synthesis/summary}

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08966 2023-08-14 cs.MM cs.CV 62%

Training Multimedia Event Extraction With Generated Images and Captions

Zilin Du, Yunxin Li, Xu Guo, Yidan Sun, Boyang Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04047 2023-08-09 cs.CV cs.AI cs.RO 62%

SODFormer: Streaming Object Detection with Transformer Using Events and Frames

Dianze Li, Jianing Li, Yonghong Tian

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 18 pages, 15 figures, in IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03908 2023-08-09 cs.CV cs.AI cs.LG 62%

ViLP: Knowledge Exploration using Vision, Language, and Pose Embeddings for Video Action Recognition

Soumyabrata Chaudhuri, Saumik Bhattacharya

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 7 pages, 3 figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03267 2023-08-08 cs.CV cs.AI 62%

Redundancy-aware Transformer for Video Question Answering

Yicong Li, Xun Yang, An Zhang, Chun Feng, Xiang Wang, Tat-Seng Chua

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACM MM23

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.11589 2023-08-04 cs.CV cs.AI cs.LG 62%

SBNet: Segmentation-based Network for Natural Language-based Vehicle Search

Sangrok Lee, Taekang Woo, Sang Hun Lee

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 7 pages, 4 figures, CVPR Workshop Paper

Journal ref 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 4049-4055

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02159 2023-07-19 cs.CV cs.MM 62%

Robustness Analysis of Video-Language Models Against Visual and Language Perturbations

Madeline C. Schiappa, Shruti Vyas, Hamid Palangi, Yogesh S. Rawat, Vibhav Vineet

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments NeurIPS 2022 Datasets and Benchmarks Track. This projects webpage is located at https://bit.ly/3CNOly4

Journal ref Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03153 2023-07-07 cs.IR cs.CV cs.MM 62%

MultiVENT: Multilingual Videos of Events with Aligned Natural Text

Kate Sanders, David Etter, Reno Kriz, Benjamin Van Durme

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01947 2023-07-06 cs.CV cs.AI cs.IR 62%

Causal Video Summarizer for Video Exploration

Jia-Hong Huang, Chao-Han Huck Yang, Pin-Yu Chen, Andrew Brown, Marcel Worring

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments This paper is accepted by IEEE International Conference on Multimedia and Expo (ICME), 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01378 2023-07-06 cs.CV cs.AI eess.IV 62%

A CNN regression model to estimate buildings height maps using Sentinel-1 SAR and Sentinel-2 MSI time series

Ritu Yadav, Andrea Nascetti, Yifang Ban

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15255 2023-06-28 cs.CV cs.CL 62%

GroundNLQ @ Ego4D Natural Language Queries Challenge 2023

Zhijian Hou, Lei Ji, Difei Gao, Wanjun Zhong, Kun Yan, Chao Li, Wing-Kwong Chan, Chong-Wah Ngo, Nan Duan, Mike Zheng Shou

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments 5 pages, 2 figures, 4 tables, the champion solution for Ego4D Natural Language Queries Challenge in CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14412 2023-06-27 cs.CV cs.MM 62%

A Solution to CVPR'2023 AQTC Challenge: Video Alignment for Multi-Step Inference

Chao Zhang, Shiwei Wu, Sirui Zhao, Tong Xu, Enhong Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 5 pages, 1 figure, technical report for track3 of CVPR 2023 LOVEU challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11025 2023-06-21 cs.LG cs.AI cs.CL q-fin.ST 62%

Temporal Data Meets LLM -- Explainable Financial Time Series Forecasting

Xinli Yu, Zheng Chen, Yuan Ling, Shujing Dong, Zongyi Liu, Yanbin Lu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07187 2023-06-13 cs.MM cs.IR cs.LG cs.SD eess.AS 62%

Video-to-Music Recommendation using Temporal Alignment of Segments

Laure Prétet, Gaël Richard, Clément Souchier, Geoffroy Peeters

专题命中 视频多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

Journal ref IEEE Transactions on Multimedia, 18 February 2022

详情

展开后加载摘要…

URL PDF HTML 收藏