arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2009.11154 2021-05-28 cs.CV cs.AI 62%

2D-3D Geometric Fusion Network using Multi-Neighbourhood Graph Convolution for RGB-D Indoor Scene Classification

Albert Mosella-Montoro, Javier Ruiz-Hidalgo

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Information Fusion 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.02209 2021-05-06 cs.CV cs.AI 62%

Physically Inspired Dense Fusion Networks for Relighting

Amirsaeed Yazdani, Tiantong Guo, Vishal Monga

专题命中 多模态训练与对齐 :any-to-any(abstract);分类 cs.CV、cs.AI

Comments Rank second in NTIRE 2021 One-to-one depth guided image relighting challenge, accepted by CVPRW 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.00421 2021-05-04 cs.CV cs.AI cs.LG 62%

A survey on VQA_Datasets and Approaches

Yeyun Zou, Qiyu Xie

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.09654 2021-04-14 cs.CL cs.AI 62%

Generative Imagination Elevates Machine Translation

Quanyu Long, Mingxuan Wang, Lei Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04829 2021-04-13 cs.CV cs.AI cs.LG 62%

Latent Code-Based Fusion: A Volterra Neural Network Approach

Sally Ghanem, Siddharth Roheda, Hamid Krim

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.05900 2021-03-11 cs.CV cs.AI 62%

RL-CSDia: Representation Learning of Computer Science Diagrams

Shaowei Wang, LingLing Zhang, Xuan Luo, Yi Yang, Xin Hu, Jun Liu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.06195 2020-10-26 cs.CV cs.CL cs.LG 62%

Large-Scale Adversarial Training for Vision-and-Language Representation Learning

Zhe Gan, Yen-Chun Chen, Linjie Li, Chen Zhu, Yu Cheng, Jingjing Liu

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2020 Spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.02582 2020-10-07 cs.CV cs.CL 62%

Finding the Evidence: Localization-aware Answer Prediction for Text Visual Question Answering

Wei Han, Hantao Huang, Tao Han

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted in COLING2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.00336 2020-08-14 cs.CL cs.CV 62%

Semi-supervised Visual Feature Integration for Pre-trained Language Models

Lisai Zhang, Qingcai Chen, Dongfang Li, Buzhou Tang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.14744 2020-07-28 cs.CL cs.CV cs.LG 62%

Graph Optimal Transport for Cross-Domain Alignment

Liqun Chen, Zhe Gan, Yu Cheng, Linjie Li, Lawrence Carin, Jingjing Liu

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL

Journal ref ICML 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11237 2020-07-14 cs.CL cs.CV cs.LG 62%

Learning to Learn Words from Visual Scenes

Dídac Surís, Dave Epstein, Heng Ji, Shih-Fu Chang, Carl Vondrick

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments 26 pages, 12 figures

Journal ref European Conference on Computer Vision (ECCV), 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.08448 2020-05-19 eess.IV cs.CV cs.MM 62%

Deep Convolutional Sparse Coding Networks for Image Fusion

Shuang Xu, Zixiang Zhao, Yicheng Wang, Chunxia Zhang, Junmin Liu, Jiangshe Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.03932 2020-05-13 cs.LG cs.AI cs.CV stat.ME stat.ML 62%

Cyclical Stochastic Gradient MCMC for Bayesian Deep Learning

Ruqi Zhang, Chunyuan Li, Jianyi Zhang, Changyou Chen, Andrew Gordon Wilson

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Published at ICLR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.02315 2020-04-28 cs.CV cs.CL cs.LG 62%

12-in-1: Multi-Task Vision and Language Representation Learning

Jiasen Lu, Vedanuj Goswami, Marcus Rohrbach, Devi Parikh, Stefan Lee

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Jiasen Lu and Vedanuj Goswami contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.08138 2019-12-12 cs.CL cs.SD eess.AS 62%

Complementary Fusion of Multi-Features and Multi-Modalities in Sentiment Analysis

Feiyang Chen, Ziqian Luo, Yanyan Xu, Dengfeng Ke

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted by AAAI2020 Workshop: AffCon2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.02866 2019-12-09 cs.CL cs.CV cs.IR 62%

Classifying Diagrams and Their Parts using Graph Neural Networks: A Comparison of Crowd-Sourced and Expert Annotations

Tuomo Hiippala

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 9 pages; submitted to LREC 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11744 2019-11-27 cs.RO cs.CL cs.CV cs.LG 62%

Imitation Learning of Robot Policies by Combining Language, Vision and Demonstration

Simon Stepputtis, Joseph Campbell, Mariano Phielipp, Chitta Baral, Heni Ben Amor

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted to the NeurIPS 2019 Workshop on Robot Learning: Control and Interaction in the Real World, Vancouver, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05054 2019-11-05 cs.CL cs.CV cs.LG 62%

Fusion of Detected Objects in Text for Visual Question Answering

Chris Alberti, Jeffrey Ling, Michael Collins, David Reitter

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.11263 2019-10-25 cs.CL cs.LG eess.AS 62%

Conversational Emotion Analysis via Attention Mechanisms

Zheng Lian, Jianhua Tao, Bin Liu, Jian Huang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、eess.AS

Journal ref Proc. Interspeech 2019, 1936-1940

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.07618 2019-09-18 cs.CV cs.MM 62%

Cycle-consistent Conditional Adversarial Transfer Networks

Jingjing Li, Erpeng Chen, Zhengming Ding, Lei Zhu, Ke Lu, Zi Huang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Codes at github.com/lijin118/3CATN

Journal ref ACM Multimedia 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.03409 2019-08-14 cs.CV cs.CL cs.LG cs.RO 62%

Transferable Representation Learning in Vision-and-Language Navigation

Haoshuo Huang, Vihan Jain, Harsh Mehta, Alexander Ku, Gabriel Magalhaes, Jason Baldridge, Eugene Ie

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments To appear in ICCV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.02265 2019-08-07 cs.CV cs.CL 62%

ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks

Jiasen Lu, Dhruv Batra, Devi Parikh, Stefan Lee

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.12133 2019-07-30 cs.CV cs.CL 62%

An Empirical Study on Leveraging Scene Graphs for Visual Question Answering

Cheng Zhang, Wei-Lun Chao, Dong Xuan

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted as oral presentation at BMVC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09037 2019-04-22 cs.LG cs.CL cs.CV stat.ML 62%

ProductNet: a Collection of High-Quality Datasets for Product Representation Learning

Chu Wang, Lei Tang, Yang Lu, Shujun Bian, Hirohisa Fujita, Da Zhang, Zuohua Zhang, Yongning Wu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.04482 2018-09-13 cs.CV cs.CL cs.LG 62%

The Visual QA Devil in the Details: The Impact of Early Fusion and Batch Norm on CLEVR

Mateusz Malinowski, Carl Doersch

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Presented at ECCV'18 Workshop on Shortcomings in Vision and Language

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.02096 2018-08-08 eess.SP cs.CV cs.LG cs.MM 62%

Semi-supervised Deep Generative Modelling of Incomplete Multi-Modality Emotional Data

Changde Du, Changying Du, Hao Wang, Jinpeng Li, Wei-Long Zheng, Bao-Liang Lu, Huiguang He

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments arXiv admin note: text overlap with arXiv:1704.07548, 2018 ACM Multimedia Conference (MM'18)

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.02314 2017-08-09 cs.AI cs.CV cs.IT math.IT 62%

Multibiometric Secure System Based on Deep Learning

Veeru Talreja, Matthew C. Valenti, Nasser M. Nasrabadi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments To be published in Proc. IEEE Global SIP 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.08386 2017-06-02 cs.CL cs.CV cs.LG 62%

Better Text Understanding Through Image-To-Text Transfer

Karol Kurach, Sylvain Gelly, Michal Jastrzebski, Philip Haeusser, Olivier Teytaud, Damien Vincent, Olivier Bousquet

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.0166 2014-01-03 cs.CV cs.AI physics.med-ph 62%

Medical Image Fusion: A survey of the state of the art

A. P. James, B. V. Dasarathy

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Information Fusion, 2014

详情

展开后加载摘要…

URL PDF HTML 收藏
1002.2755 2010-02-26 cs.CV cs.AI 62%

Multibiometrics Belief Fusion

Dakshina Ranjan Kisku, Jamuna Kanta Sing, Phalguni Gupta

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 4 pages, 3 figures

Journal ref ICMV 2009

详情

展开后加载摘要…

URL PDF HTML 收藏