arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2408.15542 2024-08-29 cs.CV cs.AI cs.MM 67%

Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input

Jiajun Liu, Yibing Wang, Hanghang Ma, Xiaoping Wu, Xiaoqi Ma, Xiaoming Wei, Jianbin Jiao, Enhua Wu, Jie Hu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06115 2024-07-09 cs.CV cs.AI cs.CL 67%

Infer Induced Sentiment of Comment Response to Video: A New Task, Dataset and Baseline

Qi Jia, Baoyu Fan, Cong Xu, Lu Liu, Liang Jin, Guoguang Du, Zhenhua Guo, Yaqian Zhao, Xuanjing Huang, Rengang Li

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14129 2024-06-21 cs.CV cs.CL cs.MM 67%

Towards Event-oriented Long Video Understanding

Yifan Du, Kun Zhou, Yuqi Huo, Yifan Li, Wayne Xin Zhao, Haoyu Lu, Zijia Zhao, Bingning Wang, Weipeng Chen, Ji-Rong Wen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

Comments Work on progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11303 2024-06-18 cs.CV cs.AI cs.CL 67%

VideoVista: A Versatile Benchmark for Video Understanding and Reasoning

Yunxin Li, Xinyu Chen, Baotian Hu, Longyue Wang, Haoyuan Shi, Min Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 38 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09275 2024-06-18 cs.CV cs.AI cs.CL cs.LG 67%

TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning

Quang Minh Dinh, Minh Khoi Ho, Anh Quan Dang, Hung Phong Tran

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2024, pp. 7134-7143

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01604 2024-06-11 cs.IR cs.AI cs.CV cs.MM 67%

An Empirical Study of Excitation and Aggregation Design Adaptions in CLIP4Clip for Video-Text Retrieval

Xiaolun Jing, Genke Yang, Jian Chu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04404 2024-05-08 cs.CV cs.AI cs.CL cs.LG 67%

Vision Mamba: A Comprehensive Survey and Taxonomy

Xiao Liu, Chenxu Zhang, Lei Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments https://github.com/lx6c78/Vision-Mamba-A-Comprehensive-Survey-and-Taxonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17929 2024-04-30 cs.CV cs.AI cs.CL 67%

Spatio-Temporal Side Tuning Pre-trained Foundation Models for Video-based Pedestrian Attribute Recognition

Xiao Wang, Qian Zhu, Jiandong Jin, Jun Zhu, Futian Wang, Bo Jiang, Yaowei Wang, Yonghong Tian

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Parameter Efficient Fine-Tuning Strategy for Video-based Pedestrian Attribute Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01327 2024-04-02 cs.CV cs.AI cs.MM 67%

Can I Trust Your Answer? Visually Grounded Video Question Answering

Junbin Xiao, Angela Yao, Yicong Li, Tat Seng Chua

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted to CVPR'24. (Compared with preprint version, we mainly improve the presentation, discuss more related works, and extend experiments in Appendix.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10228 2024-03-18 cs.CV cs.AI cs.CL 67%

HawkEye: Training Video-Text LLMs for Grounding Text in Videos

Yueqian Wang, Xiaojun Meng, Jianxin Liang, Yuxuan Wang, Qun Liu, Dongyan Zhao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05707 2024-03-04 cs.CV cs.CL cs.MM 67%

MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling

Jiaqi Xu, Bo Liu, Yunkuo Chen, Mengli Cheng, Xing Shi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09019 2024-01-18 eess.IV cs.AI cs.CV cs.MM 67%

Change Detection Between Optical Remote Sensing Imagery and Map Data via Segment Anything Model (SAM)

Hongruixuan Chen, Jian Song, Naoto Yokoya

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08720 2023-12-15 cs.AI cs.CV cs.MM 67%

Panel Transitions for Genre Analysis in Visual Narratives

Yi-Chun Chen, Arnav Jhala

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16318 2023-12-13 cs.CV cs.AI cs.MM 67%

Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation

Shilin Yan, Renrui Zhang, Ziyu Guo, Wenchao Chen, Wei Zhang, Hongyang Li, Yu Qiao, Hao Dong, Zhongjiang He, Peng Gao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by AAAI 2024. Code is released at https://github.com/OpenGVLab/MUTR

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12866 2023-11-23 cs.CV cs.AI cs.CL cs.LG 67%

Modular Blended Attention Network for Video Question Answering

Mingjie Zhou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments I will not add others' names since this work has not been published

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12159 2023-11-22 cs.CV cs.AI cs.IR cs.LG cs.MM 67%

Conditional Modeling Based Automatic Video Summarization

Jia-Hong Huang, Chao-Han Huck Yang, Pin-Yu Chen, Min-Hung Chen, Marcel Worring

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments This work has been submitted to the IEEE for possible publication. arXiv admin note: substantial text overlap with arXiv:2305.00455

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05318 2023-09-07 cs.CV cs.AI cs.LG cs.MM 67%

Generative Action Description Prompts for Skeleton-based Action Recognition

Wangmeng Xiang, Chao Li, Yuxuan Zhou, Biao Wang, Lei Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by ICCV23

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02124 2023-09-06 cs.LG eess.SP 67%

Exploiting Spatial-temporal Data for Sleep Stage Classification via Hypergraph Learning

Yuze Liu, Ziming Zhao, Tiehua Zhang, Kang Wang, Xin Chen, Xiaowei Huang, Jun Yin, Zhishu Shen

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15413 2023-07-31 cs.MM cs.AI cs.CL 67%

Improving Social Media Popularity Prediction with Multiple Post Dependencies

Zhizhen Zhang, Xiaohui Xie, Mengyu Yang, Ye Tian, Yong Jiang, Yong Cui

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06708 2023-04-14 cs.CV cs.AI cs.CL 67%

Verbs in Action: Improving verb understanding in video-language models

Liliane Momeni, Mathilde Caron, Arsha Nagrani, Andrew Zisserman, Cordelia Schmid

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14115 2023-03-22 cs.CV cs.AI cs.CL cs.LG 67%

Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning

Antoine Yang, Arsha Nagrani, Paul Hongsuck Seo, Antoine Miech, Jordi Pont-Tuset, Ivan Laptev, Josef Sivic, Cordelia Schmid

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2023 Camera-Ready; Project Webpage: https://antoyang.github.io/vid2seq.html ; 18 pages; 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07919 2023-02-17 cs.CV cs.AI cs.MM 67%

COVID-VTS: Fact Extraction and Verification on Short Video Platforms

Fuxiao Liu, Yaser Yacoob, Abhinav Shrivastava

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments 11 pages, 5 figures, accepted to EACL2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.11388 2022-12-06 cs.CV cs.AI cs.MM 67%

LGDN: Language-Guided Denoising Network for Video-Language Modeling

Haoyu Lu, Mingyu Ding, Nanyi Fei, Yuqi Huo, Zhiwu Lu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by NeurIPS2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03382 2022-10-10 cs.CV cs.AI cs.MM 67%

Temporal Feature Alignment in Contrastive Self-Supervised Learning for Human Activity Recognition

Bulat Khaertdinov, Stylianos Asteriadis

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted to IJCB 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01191 2022-10-05 cs.CV cs.AI cs.CL cs.LG 67%

Extending Compositional Attention Networks for Social Reasoning in Videos

Christina Sartzetaki, Georgios Paraskevopoulos, Alexandros Potamianos

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Journal ref Proc. Interspeech 2022, 1116-1120

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.06252 2022-08-31 cs.RO cs.AI cs.CL cs.CV 67%

What Matters in Language Conditioned Robotic Imitation Learning over Unstructured Data

Oier Mees, Lukas Hermann, Wolfram Burgard

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted for publication at IEEE Robotics and Automation Letters (RAL). Codebase and trained models available at http://hulc.cs.uni-freiburg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05739 2022-07-19 cs.CV cs.AI cs.CL cs.HC cs.MA 67%

Learning to Retrieve Videos by Asking Questions

Avinash Madasu, Junier Oliva, Gedas Bertasius

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Journal ref ACM Multimedia 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01720 2022-06-06 cs.CV cs.AI cs.CL cs.LG 67%

Revisiting the "Video" in Video-Language Understanding

Shyamal Buch, Cristóbal Eyzaguirre, Adrien Gaidon, Jiajun Wu, Li Fei-Fei, Juan Carlos Niebles

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2022 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.06197 2022-04-18 cs.CV cs.AI cs.MM 67%

Video as Conditional Graph Hierarchy for Multi-Granular Question Answering

Junbin Xiao, Angela Yao, Zhiyuan Liu, Yicong Li, Wei Ji, Tat-Seng Chua

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments AAAI'22 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.09168 2022-03-04 cs.CV cs.AI cs.MM 67%

Reading-strategy Inspired Visual Representation Learning for Text-to-Video Retrieval

Jianfeng Dong, Yabing Wang, Xianke Chen, Xiaoye Qu, Xirong Li, Yuan He, Xun Wang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology. Code is available at https://github.com/LiJiaBei-7/rivrl

详情

展开后加载摘要…

URL PDF HTML 收藏