arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2306.00958 2023-06-02 cs.RO cs.AI cs.LG 57%

LIV: Language-Image Representations and Rewards for Robotic Control

Yecheng Jason Ma, William Liang, Vaidehi Som, Vikash Kumar, Amy Zhang, Osbert Bastani, Dinesh Jayaraman

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments Extended version of ICML 2023 camera-ready; Project website: https://penn-pal-lab.github.io/LIV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12348 2023-05-23 cs.MM 57%

Social Context-aware GCN for Video Character Search via Scene-prior Enhancement

Wenjun Peng, Weidong He, Derong Xu, Tong Xu, Chen Zhu, Enhong Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

Comments Accepted by ICME 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11675 2023-05-22 cs.CV cs.CE 57%

Cinematic Mindscapes: High-quality Video Reconstruction from Brain Activity

Zijiao Chen, Jiaxin Qing, Juan Helen Zhou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 15 pages, 11 figures, submitted to anonymous conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08190 2023-05-16 cs.CV 57%

TSGN: Temporal Scene Graph Neural Networks with Projected Vectorized Representation for Multi-Agent Motion Prediction

Yunong Wu, Thomas Gilles, Bogdan Stanciulescu, Fabien Moutarde

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07910 2023-05-16 cs.CV 57%

Mask to reconstruct: Cooperative Semantics Completion for Video-text Retrieval

Han Fang, Zhifei Yang, Xianghao Zang, Chao Ban, Hao Sun

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06558 2023-05-12 cs.CV 57%

Segment and Track Anything

Yangming Cheng, Liulei Li, Yuanyou Xu, Xiaodi Li, Zongxin Yang, Wenguan Wang, Yi Yang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 3 figures; Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11116 2023-05-12 cs.AI cs.LG 57%

Graph-ToolFormer: To Empower LLMs with Graph Reasoning Ability via Prompt Augmented by ChatGPT

Jiawei Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments 34 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03910 2023-05-10 cs.CV 57%

Co-attention Propagation Network for Zero-Shot Video Object Segmentation

Gensheng Pei, Yazhou Yao, Fumin Shen, Dan Huang, Xingguo Huang, Heng-Tao Shen

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03252 2023-05-08 cs.DC cs.CV 57%

HeteroEdge: Addressing Asymmetry in Heterogeneous Collaborative Autonomous Systems

Mohammad Saeid Anwar, Emon Dey, Maloy Kumar Devnath, Indrajeet Ghosh, Naima Khan, Jade Freeman, Timothy Gregory, Niranjan Suri, Kasthuri Jayaraja, Sreenivasan Ramasamy Ramamurthy, Nirmalya Roy

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14243 2023-04-28 cs.AI 57%

Standpoint Linear Temporal Logic

Nicola Gigante, Lucia {Gomez Alvarez}, Tim S. Lyon

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08809 2023-04-19 cs.CV 57%

SViTT: Temporal Learning of Sparse Video-Text Transformers

Yi Li, Kyle Min, Subarna Tripathi, Nuno Vasconcelos

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05634 2023-04-13 cs.CV 57%

How you feelin'? Learning Emotions and Mental States in Movie Scenes

Dhruv Srivastava, Aditya Kumar Singh, Makarand Tapaswi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2023. Project Page: https://katha-ai.github.io/projects/emotx/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03697 2023-04-10 cs.LG cs.AI cs.SY eess.SY 57%

HumanLight: Incentivizing Ridesharing via Human-centric Deep Reinforcement Learning in Traffic Signal Control

Dimitris M. Vlachogiannis, Hua Wei, Scott Moura, Jane Macfarlane

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07034 2023-04-07 cs.CV 57%

A Temporal Densely Connected Recurrent Network for Event-based Human Pose Estimation

Zhanpeng Shao, Wen Zhou, Wuzhen Wang, Jianyu Yang, Youfu Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05051 2023-04-06 cs.CV 57%

VindLU: A Recipe for Effective Video-and-Language Pretraining

Feng Cheng, Xizi Wang, Jie Lei, David Crandall, Mohit Bansal, Gedas Bertasius

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2023. Project page: https://klauscc.github.io/vindlu.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.15610 2023-04-06 cs.CV 57%

Unsupervised Person Re-Identification with Wireless Positioning under Weak Scene Labeling

Yiheng Liu, Wengang Zhou, Qiaokang Xie, Houqiang Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by TPAMI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15616 2023-04-03 cs.CV 57%

Fine-grained Audible Video Description

Xuyang Shen, Dong Li, Jinxing Zhou, Zhen Qin, Bowen He, Xiaodong Han, Aixuan Li, Yuchao Dai, Lingpeng Kong, Meng Wang, Yu Qiao, Yiran Zhong

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

Comments accepted to CVPR 2023, Xuyang Shen, Dong Li and Jinxing Zhou contribute equally, code link: github.com/OpenNLPLab/FAVDBench, dataset link: www.avlbench.opennlplab.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02241 2023-04-03 cs.AI cs.RO 57%

A Memory System of a Robot Cognitive Architecture and its Implementation in ArmarX

Fabian Peller-Konrad, Rainer Kartmann, Christian R. G. Dreher, Andre Meixner, Fabian Reister, Markus Grotz, Tamim Asfour

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments 35 pages, 19 figures, submitted to RAS

Journal ref Robotics and Autonomous Systems (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00184 2023-03-29 cs.CV 57%

Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?

Wenhao Wu, Haipeng Luo, Bo Fang, Jingdong Wang, Wanli Ouyang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2023. Selected as a Highlight (Top 2.5% of ALL submissions)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13009 2023-03-24 cs.CV 57%

MELTR: Meta Loss Transformer for Learning to Fine-tune Video Foundation Models

Dohwan Ko, Joonmyung Choi, Hyeong Kyu Choi, Kyoung-Woon On, Byungseok Roh, Hyunwoo J. Kim

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted paper at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09825 2023-03-20 cs.RO cs.CV 57%

LCE-Calib: Automatic LiDAR-Frame/Event Camera Extrinsic Calibration With A Globally Optimal Solution

Jianhao Jiao, Feiyi Chen, Hexiang Wei, Jin Wu, Ming Liu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 11 pages, 13 figures, accepted to IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09733 2023-03-20 cs.CV 57%

Scribble-Supervised RGB-T Salient Object Detection

Zhengyi Liu, Xiaoshen Huang, Guanghui Zhang, Xianyong Fang, Linbo Wang, Bin Tang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments ICME2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11217 2023-03-16 cs.CV 57%

Connecting Vision and Language with Video Localized Narratives

Paul Voigtlaender, Soravit Changpinyo, Jordi Pont-Tuset, Radu Soricut, Vittorio Ferrari

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01953 2023-03-10 cs.CV 57%

Learning Trajectory-Word Alignments for Video-Language Tasks

Xu Yang, Zhangzikang Li, Haiyang Xu, Hanwang Zhang, Qinghao Ye, Chenliang Li, Ming Yan, Yu Zhang, Fei Huang, Songfang Huang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.08323 2023-03-10 cs.CV cs.RO 57%

RGB-Event Fusion for Moving Object Detection in Autonomous Driving

Zhuyun Zhou, Zongwei Wu, Rémi Boutteau, Fan Yang, Cédric Demonceaux, Dominique Ginhac

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments ICRA'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02203 2023-03-07 cs.CV cs.RO 57%

X$^3$KD: Knowledge Distillation Across Modalities, Tasks and Stages for Multi-Camera 3D Object Detection

Marvin Klingner, Shubhankar Borse, Varun Ravi Kumar, Behnaz Rezaei, Venkatraman Narayanan, Senthil Yogamani, Fatih Porikli

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13933 2023-02-28 cs.CV 57%

LAformer: Trajectory Prediction for Autonomous Driving with Lane-Aware Scene Constraints

Mengmeng Liu, Hao Cheng, Lin Chen, Hellward Broszio, Jiangtao Li, Runjiang Zhao, Monika Sester, Michael Ying Yang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04860 2023-02-10 cs.CV 57%

Diverse Human Motion Prediction Guided by Multi-Level Spatial-Temporal Anchors

Sirui Xu, Yu-Xiong Wang, Liang-Yan Gui

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments ECCV 2022 (Oral); Project Page: https://sirui-xu.github.io/STARS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00986 2023-01-23 cs.CV cs.CR cs.LG 57%

Look, Listen, and Attack: Backdoor Attacks Against Video Action Recognition

Hasan Abed Al Kader Hammoud, Shuming Liu, Mohammed Alkhrashi, Fahad AlBalawi, Bernard Ghanem

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.06082 2023-01-18 cs.CV 57%

A Survey on Human Action Recognition

Zhou Shuchang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏