arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3475 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3475 篇

2101.02358 2021-01-08 cs.LG cs.CV stat.ML 79%

OAAE: Adversarial Autoencoders for Novelty Detection in Multi-modal Normality Case via Orthogonalized Latent Space

Sungkwon An, Jeonghoon Kim, Myungjoo Kang, Shahbaz Razaei, Xin Liu

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted to AAAI 2021 Workshop: Towards Robust, Secure and Efficient Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.13538 2020-12-29 cs.IR cs.CV 79%

Comprehensive Graph-conditional Similarity Preserving Network for Unsupervised Cross-modal Hashing

Jun Yu, Hao Zhou, Yibing Zhan, Dacheng Tao

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.04329 2020-12-09 cs.CV 79%

StacMR: Scene-Text Aware Cross-Modal Retrieval

Andrés Mafla, Rafael Sampaio de Rezende, Lluís Gómez, Diane Larlus, Dimosthenis Karatzas

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.00682 2020-12-02 cs.LG cs.CV 79%

Learning Disentangled Latent Factors from Paired Data in Cross-Modal Retrieval: An Implicit Identifiable VAE Approach

Minyoung Kim, Ricardo Guerrero, Vladimir Pavlovic

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12349 2020-12-01 cs.LG cs.CL cs.IR 79%

Improving Clinical Outcome Predictions Using Convolution over Medical Entities with Multimodal Learning

Batuhan Bardak, Mehmet Tan

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments 21 pages, 2 figures, Submitted to Elsevier (Artificial Intelligence in Medicine)

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.03291 2020-11-02 cs.CL cs.IR cs.LG 79%

Aligning Multilingual Word Embeddings for Cross-Modal Retrieval Task

Alireza Mohammadshahi, Remi Lebret, Karl Aberer

专题命中 跨模态检索 :cross-modal(title);multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.04339 2020-10-12 cs.CV cs.RO 79%

MMGSD: Multi-Modal Gaussian Shape Descriptors for Correspondence Matching in 1D and 2D Deformable Objects

Aditya Ganapathi, Priya Sundaresan, Brijen Thananjeyan, Ashwin Balakrishna, Daniel Seita, Ryan Hoque, Joseph E. Gonzalez, Ken Goldberg

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments IROS 2020 Workshop on Managing Deformation: A Step Towards Higher Robot Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.02698 2020-10-07 cs.CV 79%

Deep Robust Multilevel Semantic Cross-Modal Hashing

Ge Song, Jun Zhao, Xiaoyang Tan

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments 11 pages, 9 figures, submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.06390 2020-10-02 cs.CL cs.IR cs.LG 79%

A Feature Analysis for Multimodal News Retrieval

Golsa Tahmasebzadeh, Sherzod Hakimov, Eric Müller-Budack, Ralph Ewerth

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments CLEOPATRA Workshop co-located with ESWC 2020

Journal ref CLEOPATRA Workshop co-located with ESWC 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.09809 2020-09-22 cs.CV 79%

Multi-Modal Reasoning Graph for Scene-Text Based Fine-Grained Image Classification and Retrieval

Andres Mafla, Sounak Dey, Ali Furkan Biten, Lluis Gomez, Dimosthenis Karatzas

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.07162 2020-09-16 cs.CL 79%

Multimodal Joint Attribute Prediction and Value Extraction for E-commerce Product

Tiangang Zhu, Yue Wang, Haoran Li, Youzheng Wu, Xiaodong He, Bowen Zhou

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Accepted by EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.15103 2020-08-12 cs.CV cs.IR 79%

Cross-Modal Hierarchical Modelling for Fine-Grained Sketch Based Image Retrieval

Aneeshan Sain, Ayan Kumar Bhunia, Yongxin Yang, Tao Xiang, Yi-Zhe Song

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments Accepted for ORAL presentation in BMVC 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.03561 2020-08-11 cs.CV 79%

Cross-modal Center Loss

Longlong Jing, Elahe Vahdani, Jiaxing Tan, Yingli Tian

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.11067 2020-07-23 cs.CV 79%

Self-supervised Feature Learning via Exploiting Multi-modal Data for Retinal Disease Diagnosis

Xiaomeng Li, Mengyu Jia, Md Tauhidul Islam, Lequan Yu, Lei Xing

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments IEEE Transactions on Medical Imaging, code is at https://github.com/xmengli999/self_supervised

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.02503 2020-07-07 cs.CV 79%

Tree-Augmented Cross-Modal Encoding for Complex-Query Video Retrieval

Xun Yang, Jianfeng Dong, Yixin Cao, Xun Wang, Meng Wang, Tat-Seng Chua

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments Accepted For 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10314 2020-07-06 cs.CV 79%

Multimodal Prediction based on Graph Representations

Icaro Cavalcante Dourado, Salvatore Tabbone, Ricardo da Silva Torres

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.08765 2020-06-17 cs.LG cs.AI 79%

COMPOSE: Cross-Modal Pseudo-Siamese Network for Patient Trial Matching

Junyi Gao, Cao Xiao, Lucas M. Glass, Jimeng Sun

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.AI

Comments Accepted by KDD'20

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.09801 2020-06-01 cs.IR cs.CV cs.LG eess.IV 79%

FashionBERT: Text and Image Matching with Adaptive Loss for Cross-modal Retrieval

Dehong Gao, Linbo Jin, Ben Chen, Minghui Qiu, Peng Li, Yi Wei, Yi Hu, Hao Wang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments 10 pages, to be published in SIGIR20 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.08299 2020-04-20 cs.CL cs.LG 79%

DSTC8-AVSD: Multimodal Semantic Transformer Network with Retrieval Style Word Generator

Hwanhee Lee, Seunghyun Yoon, Franck Dernoncourt, Doo Soon Kim, Trung Bui, Kyomin Jung

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Presented at DSTC Workshop @ AAAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.03378 2020-04-08 cs.CV 79%

Error-Corrected Margin-Based Deep Cross-Modal Hashing for Facial Image Retrieval

Fariborz Taherkhani, Veeru Talreja, Matthew C. Valenti, Nasser M. Nasrabadi

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments IEEE TRANSACTIONS ON BIOMETRICS, BEHAVIOR, AND IDENTITY SCIENCE, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.00280 2020-04-02 cs.CV 79%

Creating Something from Nothing: Unsupervised Knowledge Distillation for Cross-Modal Hashing

Hengtong Hu, Lingxi Xie, Richang Hong, Qi Tian

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments This paper has been accepted for CVPR2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.13962 2020-04-01 cs.CV 79%

Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text

Difei Gao, Ke Li, Ruiping Wang, Shiguang Shan, Xilin Chen

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments Published as a CVPR2020 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.01607 2020-03-04 cs.CV 79%

Deep Multi-Modal Sets

Austin Reiter, Menglin Jia, Pu Yang, Ser-Nam Lim

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments 10 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.00677 2020-02-04 cs.CV 79%

A Novel Incremental Cross-Modal Hashing Approach

Devraj Mandal, Soma Biswas

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments 20 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.11101 2020-01-31 cs.LG cs.CV stat.ML 79%

Urban2Vec: Incorporating Street View Imagery and POIs for Multi-Modal Urban Neighborhood Embedding

Zhecheng Wang, Haoyuan Li, Ram Rajagopal

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments To appear in Proceedings of the Thirty-Fourth AAAI Conference on Artificial Intelligence (AAAI-20)

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.04625 2020-01-15 cs.IR cs.CV cs.LG 79%

Asymmetric Correlation Quantization Hashing for Cross-modal Retrieval

Lu Wang, Jie Yang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.10542 2019-10-24 eess.IV cs.CV 79%

Deep generative model-driven multimodal prostate segmentation in radiotherapy

Kibrom Berihu Girum, Gilles Créhange, Raabid Hussain, Paul Michael Walker, Alain Lalande

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Comments 8 pages, camera ready paper, accepted for Artificial Intelligence in Radiation Therapy (AIRT), in conjunction with MICCAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.05506 2019-09-13 cs.CV 79%

CAMP: Cross-Modal Adaptive Message Passing for Text-Image Retrieval

Zihao Wang, Xihui Liu, Hongsheng Li, Lu Sheng, Junjie Yan, Xiaogang Wang, Jing Shao

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.11125 2019-08-30 cs.CL 79%

Probing Representations Learned by Multimodal Recurrent and Transformer Models

Jindřich Libovický, Pranava Madhyastha

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.06620 2019-06-18 cs.LG cs.CV cs.IR stat.ML 79%

Joint Visual-Textual Embedding for Multimodal Style Search

Gil Sadeh, Lior Fritz, Gabi Shalev, Eduard Oks

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏