arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2406.01256 2024-06-04 cs.CV cs.AI 62%

Augmented Commonsense Knowledge for Remote Object Grounding

Bahram Mohammadi, Yicong Hong, Yuankai Qi, Qi Wu, Shirui Pan, Javen Qinfeng Shi

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13611 2024-06-04 cs.CV cs.CL 62%

Video sentence grounding with temporally global textual knowledge

Cai Chen, Runzhong Zhang, Jianjun Gao, Kejun Wu, Kim-Hui Yap, Yi Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12540 2024-05-22 cs.CV cs.MM 62%

Context-Enhanced Video Moment Retrieval with Large Language Models

Weijia Liu, Bo Miao, Jiuxin Cao, Xuelin Zhu, Bo Liu, Mehwish Nasim, Ajmal Mian

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07759 2024-05-21 cs.MM cs.AI cs.NI eess.IV 62%

MADRL-Based Rate Adaptation for 360° Video Streaming with Multi-Viewpoint Prediction

Haopeng Wang, Zijian Long, Haiwei Dong, Abdulmotaleb El Saddik

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI、cs.MM

Comments Accepted by IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18174 2024-04-30 cs.CV cs.AI 62%

Mamba-FETrack: Frame-Event Tracking via State Space Model

Ju Huang, Shiao Wang, Shuai Wang, Zhe Wu, Xiao Wang, Bo Jiang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments In Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15719 2024-04-26 cs.CV cs.AI 62%

HDBN: A Novel Hybrid Dual-branch Network for Robust Skeleton-based Action Recognition

Jinfu Liu, Baiqiao Yin, Jiaying Lin, Jiajun Wen, Yue Li, Mengyuan Liu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12782 2024-04-22 cs.CV cs.AI 62%

Sentiment-oriented Transformer-based Variational Autoencoder Network for Live Video Commenting

Fengyi Fu, Shancheng Fang, Weidong Chen, Zhendong Mao

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 27 pages, 10 figures, ACM Transactions on Multimedia Computing, Communications and Applications, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09055 2024-04-16 cs.CV cs.AI 62%

Comment-aided Video-Language Alignment via Contrastive Pre-training for Short-form Video Humor Detection

Yang Liu, Tongfei Shen, Dong Zhang, Qingying Sun, Shoushan Li, Guodong Zhou

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICMR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19046 2024-03-29 cs.CV cs.AI 62%

LITA: Language Instructed Temporal-Localization Assistant

De-An Huang, Shijia Liao, Subhashree Radhakrishnan, Hongxu Yin, Pavlo Molchanov, Zhiding Yu, Jan Kautz

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.04132 2024-03-26 q-bio.NC cs.AI cs.CV cs.RO 62%

A Number Sense as an Emergent Property of the Manipulating Brain

Neehar Kondapaneni, Pietro Perona

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 16 pages, 5 figures, 15 supplemental figures

Journal ref Scientific reports, 14(6858) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14870 2024-03-25 cs.CV cs.CL cs.LG 62%

VidLA: Video-Language Alignment at Scale

Mamshad Nayeem Rizve, Fan Fei, Jayakrishnan Unnikrishnan, Son Tran, Benjamin Z. Yao, Belinda Zeng, Mubarak Shah, Trishul Chilimbi

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10900 2024-03-19 cs.CV cs.AI 62%

MotionGPT: Finetuned LLMs Are General-Purpose Motion Generators

Yaqi Zhang, Di Huang, Bin Liu, Shixiang Tang, Yan Lu, Lu Chen, Lei Bai, Qi Chu, Nenghai Yu, Wanli Ouyang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 18 pages, 8 figures, accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07944 2024-03-14 cs.CV cs.AI 62%

WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs

Deshun Yang, Luhui Hu, Yu Tian, Zihao Li, Chris Kelly, Bang Yang, Cindy Yang, Yuexian Zou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12545 2024-02-29 cs.CV cs.AI 62%

Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model

Peng Wu, Jing Liu, Xiangteng He, Yuxin Peng, Peng Wang, Yanning Zhang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments This work has been accepted to the IEEE TIP. Copyright has been transferred

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12079 2024-02-20 cs.CV cs.CL 62%

LVCHAT: Facilitating Long Video Comprehension

Yu Wang, Zeyuan Zhang, Julian McAuley, Zexue He

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 17 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03413 2024-02-07 cs.MM cs.CV eess.IV 62%

Perceptual Video Quality Assessment: A Survey

Xiongkuo Min, Huiyu Duan, Wei Sun, Yucheng Zhu, Guangtao Zhai

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17343 2024-02-01 cs.CV cs.AI 62%

YTCommentQA: Video Question Answerability in Instructional Videos

Saelyne Yang, Sunghyun Park, Yunseok Jang, Moontae Lee

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17151 2024-01-31 cs.MM cs.CV 62%

An Open Software Suite for Event-Based Video

Andrew C. Freeman

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14856 2024-01-29 cs.CV cs.AI 62%

Memory-Inspired Temporal Prompt Interaction for Text-Image Classification

Xinyao Yu, Hao Sun, Ziwei Niu, Rui Qin, Zhenjia Bai, Yen-Wei Chen, Lanfen Lin

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00496 2024-01-25 cs.CV cs.AI cs.LG 62%

SAR-RARP50: Segmentation of surgical instrumentation and Action Recognition on Robot-Assisted Radical Prostatectomy Challenge

Dimitrios Psychogyios, Emanuele Colleoni, Beatrice Van Amsterdam, Chih-Yang Li, Shu-Yu Huang, Yuchong Li, Fucang Jia, Baosheng Zou, Guotai Wang, Yang Liu, Maxence Boels, Jiayu Huo, Rachel Sparks, Prokar Dasgupta, Alejandro Granados, Sebastien Ourselin, Mengya Xu, An Wang, Yanan Wu, Long Bai, Hongliang Ren, Atsushi Yamada, Yuriko Harai, Yuto Ishikawa, Kazuyuki Hayashi, Jente Simoens, Pieter DeBacker, Francesco Cisternino, Gabriele Furnari, Alex Mottrie, Federica Ferraguti, Satoshi Kondo, Satoshi Kasai, Kousuke Hirasawa, Soohee Kim, Seung Hyun Lee, Kyu Eun Lee, Hyoun-Joong Kong, Kui Fu, Chao Li, Shan An, Stefanie Krell, Sebastian Bodenstedt, Nicolas Ayobi, Alejandra Perez, Santiago Rodriguez, Juanita Puentes, Pablo Arbelaez, Omid Mohareri, Danail Stoyanov

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01852 2024-01-23 cs.CV cs.AI 62%

LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment

Bin Zhu, Bin Lin, Munan Ning, Yang Yan, Jiaxi Cui, HongFa Wang, Yatian Pang, Wenhao Jiang, Junwu Zhang, Zongwei Li, Wancai Zhang, Zhifeng Li, Wei Liu, Li Yuan

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17212 2024-01-19 cs.CV cs.AI 62%

Affective Video Content Analysis: Decade Review and New Perspectives

Junxiao Xue, Jie Wang, Xuecheng Wu, Qian Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11650 2024-01-10 cs.IR cs.CV cs.MM 62%

VKIE: The Application of Key Information Extraction on Video Text

Siyu An, Ye Liu, Haoyuan Peng, Di Yin

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03901 2024-01-09 cs.CV cs.CL 62%

STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering

Yueqian Wang, Yuxuan Wang, Kai Chen, Dongyan Zhao

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments To appear in AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11467 2024-01-04 cs.CV cs.AI 62%

SkateboardAI: The Coolest Video Action Recognition for Skateboarding

Hanxiao Chen

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments The original first-author work has been accepted and presented by CVPR 2022 WiCV Workshop (This is the long-version paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16933 2023-12-29 cs.CV cs.AI 62%

EvPlug: Learn a Plug-and-Play Module for Event and Image Fusion

Jianping Jiang, Xinyu Zhou, Peiqi Duan, Boxin Shi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07207 2023-12-21 cs.CV cs.CL 62%

Beyond Grounding: Extracting Fine-Grained Event Hierarchies Across Modalities

Hammad A. Ayyubi, Christopher Thomas, Lovish Chum, Rahul Lokesh, Long Chen, Yulei Niu, Xudong Lin, Xuande Feng, Jaywon Koo, Sounak Ray, Shih-Fu Chang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09627 2023-12-18 cs.CV cs.IR cs.LG cs.MM 62%

TF-CLIP: Learning Text-free CLIP for Video-based Person Re-Identification

Chenyang Yu, Xuehu Liu, Yingquan Wang, Pingping Zhang, Huchuan Lu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments This work is accepted by AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13859 2023-12-18 cs.CL cs.CV 62%

Not all Fake News is Written: A Dataset and Analysis of Misleading Video Headlines

Yoo Yeon Sung, Jordan Boyd-Graber, Naeemul Hassan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments EMNLP 2023 Main Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13435 2023-12-14 cs.CV cs.AI 62%

PG-Video-LLaVA: Pixel Grounding Large Video-Language Models

Shehan Munasinghe, Rusiru Thushara, Muhammad Maaz, Hanoona Abdul Rasheed, Salman Khan, Mubarak Shah, Fahad Khan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏