arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2108.11945 2021-08-27 cs.RO cs.CL cs.CV 62%

SASRA: Semantically-aware Spatio-temporal Reasoning Agent for Vision-and-Language Navigation in Continuous Environments

Muhammad Zubair Irshad, Niluthpol Chowdhury Mithun, Zachary Seymour, Han-Pang Chiu, Supun Samarasekera, Rakesh Kumar

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.08633 2021-08-20 cs.CV cs.MM 62%

Spatio-Temporal Interaction Graph Parsing Networks for Human-Object Interaction Recognition

Ning Wang, Guangming Zhu, Liang Zhang, Peiyi Shen, Hongsheng Li, Cong Hua

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments ACM MM Oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.05158 2021-08-12 cs.CV cs.AI 62%

Mounting Video Metadata on Transformer-based Language Model for Open-ended Video Question Answering

Donggeon Lee, Seongho Choi, Youwon Jang, Byoung-Tak Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.03543 2021-08-10 cs.CV cs.AI 62%

Spatio-Temporal Attention Mechanism and Knowledge Distillation for Lip Reading

Shahd Elashmawy, Marian Ramsis, Hesham M. Eraqi, Farah Eldeshnawy, Hadeel Mabrouk, Omar Abugabal, Nourhan Sakr

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02365 2021-08-06 cs.CV cs.CL 62%

Hybrid Reasoning Network for Video-based Commonsense Captioning

Weijiang Yu, Jian Liang, Lei Ji, Lu Li, Yuejian Fang, Nong Xiao, Nan Duan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.01619 2021-06-30 cs.CV cs.AI cs.LG cs.RO 62%

Relational Graph Learning on Visual and Kinematics Embeddings for Accurate Gesture Recognition in Robotic Surgery

Yonghao Long, Jie Ying Wu, Bo Lu, Yueming Jin, Mathias Unberath, Yun-Hui Liu, Pheng Ann Heng, Qi Dou

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted for ICRA 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.10446 2021-06-22 cs.CV cs.AI 62%

Attend What You Need: Motion-Appearance Synergistic Networks for Video Question Answering

Ahjeong Seo, Gi-Cheon Kang, Joonhan Park, Byoung-Tak Zhang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments ACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09756 2021-06-21 cs.LG cs.AI cs.CV stat.ML 62%

PyKale: Knowledge-Aware Machine Learning from Multiple Sources in Python

Haiping Lu, Xianyuan Liu, Robert Turner, Peizhen Bai, Raivo E Koot, Shuo Zhou, Mustafa Chasmai, Lawrence Schobs

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This library is available at https://github.com/pykale/pykale

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06160 2021-05-17 cs.CV cs.AI 62%

Relation-aware Hierarchical Attention Framework for Video Question Answering

Fangtao Li, Ting Bai, Chenyu Cao, Zihe Liu, Chenghao Yan, Bin Wu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 9 pages, This paper is accepted by ICMR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04369 2021-05-05 cs.CV cs.CL 62%

Video-aided Unsupervised Grammar Induction

Songyang Zhang, Linfeng Song, Lifeng Jin, Kun Xu, Dong Yu, Jiebo Luo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments This paper is accepted by NAACL'21

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.09427 2021-02-22 cs.CL cs.AI 62%

Towards Natural Language Question Answering over Earth Observation Linked Data using Attention-based Neural Machine Translation

Abhishek V. Potnis, Rajat C. Shinde, Surya S. Durbha

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.05381 2021-02-19 cs.CV cs.IR cs.MM 62%

Dual Encoding for Video Retrieval by Text

Jianfeng Dong, Xirong Li, Chaoxi Xu, Xun Yang, Gang Yang, Xun Wang, Meng Wang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence. Code and data will be available at https://github.com/danieljf24/hybrid_space. Conference version: arXiv:1809.06181

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.02639 2021-01-21 cs.CV cs.IR cs.LG cs.MM 62%

Rethinking movie genre classification with fine-grained semantic clustering

Edward Fish, Jon Weinbren, Andrew Gilbert

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.02458 2021-01-08 cs.CV cs.AI 62%

Associated Spatio-Temporal Capsule Network for Gait Recognition

Aite Zhao, Junyu Dong, Jianbo Li, Lin Qi, Huiyu Zhou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.10285 2020-12-21 cs.CV cs.CL 62%

Trying Bilinear Pooling in Video-QA

Thomas Winterbottom, Sarah Xiao, Alistair McLean, Noura Al Moubayed

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 16 Pages, 8 Figures, 4 Tables, +Supp Mats

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.07536 2020-12-15 cs.CL cs.CV 62%

Movie Summarization via Sparse Graph Construction

Pinelopi Papalampidi, Frank Keller, Mirella Lapata

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted at AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12143 2020-11-25 cs.CV cs.AI cs.LG 62%

Deep learning for video game genre classification

Yuhang Jiang, Lukun Zheng

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 6 figures, 3 tables. arXiv admin note: substantial text overlap with arXiv:2011.07658

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.11400 2020-11-24 cs.AI cs.CL q-bio.NC 62%

Language guided machine action

Feng Qi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.14701 2020-11-09 cs.LG cs.CL cs.CV 62%

Scaling Laws for Autoregressive Generative Modeling

Tom Henighan, Jared Kaplan, Mor Katz, Mark Chen, Christopher Hesse, Jacob Jackson, Heewoo Jun, Tom B. Brown, Prafulla Dhariwal, Scott Gray, Chris Hallacy, Benjamin Mann, Alec Radford, Aditya Ramesh, Nick Ryder, Daniel M. Ziegler, John Schulman, Dario Amodei, Sam McCandlish

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 20+17 pages, 33 figures; added appendix with additional language results

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.16073 2020-11-02 cs.CV cs.LG cs.MM eess.IV 62%

CNN based Multistage Gated Average Fusion (MGAF) for Human Action Recognition Using Depth and Inertial Sensors

Zeeshan Ahmad, Naimul khan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments arXiv admin note: text overlap with arXiv:1910.11482

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.03626 2020-07-08 cs.CL cs.CV cs.LG stat.ML 62%

What Gives the Answer Away? Question Answering Bias Analysis on Video QA Datasets

Jianing Yang, Yuying Zhu, Yongxin Wang, Ruitao Yi, Amir Zadeh, Louis-Philippe Morency

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.15319 2020-06-30 cs.CL cs.CV cs.LG 62%

Video-Grounded Dialogues with Pretrained Generation Language Models

Hung Le, Steven C. H. Hoi

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.CL

Comments Accepted at ACL 2020 (Short Paper)

Journal ref Association for Computational Linguistics (2020) 5842-5848

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.13931 2020-06-16 cs.CL cs.CV 62%

Span-based Localizing Network for Natural Language Video Localization

Hao Zhang, Aixin Sun, Wei Jing, Joey Tianyi Zhou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments To appear at ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.09183 2020-05-20 cs.CV cs.CL cs.IR 62%

Retrieving and Highlighting Action with Spatiotemporal Reference

Seito Kasai, Yuchi Ishikawa, Masaki Hayashi, Yoshimitsu Aoki, Kensho Hara, Hirokatsu Kataoka

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted to ICIP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.09418 2020-05-15 cs.MM cs.CV 62%

Video Storytelling: Textual Summaries for Events

Junnan Li, Yongkang Wong, Qi Zhao, Mohan S. Kankanhalli

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Published in IEEE Transactions on Multimedia

Journal ref J. Li, Y. Wong, Q. Zhao and M. S. Kankanhalli, "Video Storytelling: Textual Summaries for Events," in IEEE Transactions on Multimedia, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.10606 2020-03-25 cs.CV cs.CL 62%

Video Object Grounding using Semantic Roles in Language Description

Arka Sadhu, Kan Chen, Ram Nevatia

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments CVPR20 camera-ready including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.02265 2020-02-07 cs.CV cs.CL cs.LG stat.ML 62%

Zero-Shot Activity Recognition with Videos

Evin Pinar Ornek

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments This is a research report done during master's studies

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.01108 2019-12-02 cs.CV cs.CL 62%

Language2Pose: Natural Language Grounded Pose Forecasting

Chaitanya Ahuja, Louis-Philippe Morency

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.06693 2019-10-16 cs.CV cs.LG eess.AS 62%

Seeing and Hearing Egocentric Actions: How Much Can We Learn?

Alejandro Cartas, Jordi Luque, Petia Radeva, Carlos Segura, Mariella Dimiccoli

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、eess.AS

Comments Accepted for the Fifth International Workshop on Egocentric Perception, Interaction and Computing (EPIC) at the International Conference on Computer Vision (ICCV) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11023 2019-09-25 cs.CV cs.LG cs.MM 62%

Posture and sequence recognition for Bharatanatyam dance performances using machine learning approach

Tanwi Mallick, Partha Pratim Das, Arun Kumar Majumdar

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏