arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3484 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3484 篇

2401.01065 2024-06-19 cs.CV cs.AI 62%

BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous Driving

Tao Tang, Dafeng Wei, Zhengyu Jia, Tian Gao, Changwei Cai, Chengkai Hou, Peng Jia, Kun Zhan, Haiyang Sun, Jingchen Fan, Yixing Zhao, Fu Liu, Xiaodan Liang, Xianpeng Lang, Yang Wang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18570 2024-06-10 cs.CV cs.CL cs.IR cs.LG 62%

It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap

Abrar Fahim, Alex Murphy, Alona Fyshe

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03158 2024-06-06 cs.CL cs.AI 62%

CSS: Contrastive Semantic Similarity for Uncertainty Quantification of LLMs

Shuang Ao, Stefan Rueger, Advaith Siddharthan

专题命中 跨模态检索 :image-text(abstract);分类 cs.CL、cs.AI

Comments The paper is accepted by The Conference on Uncertainty in Artificial Intelligence (UAI), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20245 2024-05-31 cs.CL cs.AI cs.IR cs.LG 62%

Retrieval Augmented Structured Generation: Business Document Information Extraction As Tool Use

Franz Louis Cesista, Rui Aguiar, Jason Kim, Paolo Acilo

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted by IEEE 7th International Conference on Multimedia Information Processing and Retrieval (MIPR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14084 2024-05-28 cs.IR cs.AI cs.CV 62%

Invisible Relevance Bias: Text-Image Retrieval Models Prefer AI-Generated Images

Shicheng Xu, Danyang Hou, Liang Pang, Jingcheng Deng, Jun Xu, Huawei Shen, Xueqi Cheng

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by SIGIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09286 2024-05-16 cs.MM cs.CV 62%

MVBIND: Self-Supervised Music Recommendation For Videos Via Embedding Space Binding

Jiajie Teng, Huiyu Duan, Yucheng Zhu, Sijing Wu, Guangtao Zhai

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01468 2024-05-03 cs.LG cs.AI cs.CV 62%

Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models

Yifei Ming, Yixuan Li

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments The paper is accepted at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19360 2024-05-01 cs.CV cs.CL cs.IR 62%

Large Language Model Informed Patent Image Retrieval

Hao-Cheng Lo, Jung-Mei Chu, Jieh Hsiang, Chun-Chieh Cho

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 8 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03798 2024-04-18 cs.CV cs.AI cs.LG cs.NE 62%

Fooling Contrastive Language-Image Pre-trained Models with CLIPMasterPrints

Matthias Freiberger, Peter Kun, Christian Igel, Anders Sundnes Løvlie, Sebastian Risi

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments This work was supported by a research grant (40575) from VILLUM FONDEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10241 2024-04-17 cs.CV cs.AI 62%

Vision-and-Language Navigation via Causal Learning

Liuyi Wang, Zongtao He, Ronghao Dang, Mengjiao Shen, Chengju Liu, Qijun Chen

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05902 2024-04-10 cs.CL cs.AI 62%

WILBUR: Adaptive In-Context Learning for Robust and Accurate Web Agents

Michael Lutz, Arth Bohra, Manvel Saroyan, Artem Harutyunyan, Giovanni Campagna

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05502 2024-04-09 cs.CL cs.AI 62%

PetKaz at SemEval-2024 Task 3: Advancing Emotion Classification with an LLM for Emotion-Cause Pair Extraction in Conversations

Roman Kazakov, Kseniia Petukhova, Ekaterina Kochmar

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 7 figures, 2 tables, to be published in the Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024), for associated code, see https://github.com/sachertort/petkaz-semeval-ecac

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03323 2024-04-05 cs.CV cs.AI 62%

Sparse Concept Bottleneck Models: Gumbel Tricks in Contrastive Learning

Andrei Semenov, Vladimir Ivanov, Aleksandr Beznosikov, Alexander Gasnikov

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 23 pages, 1 algorithm, 36 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15276 2024-04-04 cs.IR cs.AI cs.CV 62%

CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora

Zijun Long, Xuri Ge, Richard Mccreadie, Joemon Jose

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14551 2024-03-22 cs.CL cs.AI cs.LG 62%

Lexicon-Level Contrastive Visual-Grounding Improves Language Modeling

Chengxu Zhuang, Evelina Fedorenko, Jacob Andreas

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07952 2024-03-19 cs.CV cs.CL cs.LG 62%

MOFI: Learning Image Representations from Noisy Entity Annotated Images

Wentao Wu, Aleksei Timofeev, Chen Chen, Bowen Zhang, Kun Duan, Shuangning Liu, Yantao Zheng, Jonathon Shlens, Xianzhi Du, Zhe Gan, Yinfei Yang

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00691 2024-03-04 cs.CV cs.AI 62%

Tri-Modal Motion Retrieval by Learning a Joint Embedding Space

Kangning Yin, Shihao Zou, Yuxuan Ge, Zheng Tian

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15103 2024-02-26 cs.LG cs.AI cs.CV 62%

Contrastive Learning Is Spectral Clustering On Similarity Graph

Zhiquan Tan, Yifan Zhang, Jingqin Yang, Yang Yuan

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments ICLR 2024; We express our gratitude to the anonymous reviewers for their valuable feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10921 2024-02-20 cs.AI cs.CV cs.LG 62%

AM^2-EmoJE: Adaptive Missing-Modality Emotion Recognition in Conversation via Joint Embedding Learning

Naresh Kumar Devulapally, Sidharth Anand, Sreyasee Das Bhattacharjee, Junsong Yuan

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13613 2024-01-25 cs.CV cs.AI 62%

Enhancing Image Retrieval : A Comprehensive Study on Photo Search using the CLIP Mode

Naresh Kumar Lahajal, Harini S

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02979 2024-01-09 cs.CL cs.AI cs.IR 62%

Are we describing the same sound? An analysis of word embedding spaces of expressive piano performance

Silvan David Peter, Shreyan Chowdhury, Carlos Eduardo Cancino-Chacón, Gerhard Widmer

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL、cs.AI

Journal ref Proceedings of the Forum for Information Retrieval Evaluation, FIRE, 2023, Panjim, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02309 2024-01-08 cs.CV cs.MM 62%

TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection

Hao Sun, Mingyao Zhou, Wenjing Chen, Wei Xie

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by AAAI-24

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06854 2023-12-21 cs.CV cs.CL cs.CR cs.LG 62%

Robust Contrastive Language-Image Pre-training against Data Poisoning and Backdoor Attacks

Wenhan Yang, Jingdong Gao, Baharan Mirzasoleiman

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18890 2023-12-19 cs.CV cs.AI 62%

Towards Generalized Multi-stage Clustering: Multi-view Self-distillation

Jiatai Wang, Zhiwei Xu, Xin Wang, Tao Li

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06497 2023-12-15 cs.CV cs.AI 62%

DRUformer: Enhancing the driving scene Important object detection with driving relationship self-understanding

Yingjie Niu, Ming Ding, Keisuke Fujii, Kento Ohtani, Alexander Carballo, Kazuya Takeda

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18273 2023-12-01 cs.CV cs.MM 62%

HKUST at SemEval-2023 Task 1: Visual Word Sense Disambiguation with Context Augmentation and Visual Assistance

Zhuohao Yin, Xin Huang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16464 2023-11-29 cs.CV cs.AI 62%

Bridging the Gap: A Unified Video Comprehension Framework for Moment Retrieval and Highlight Detection

Yicheng Xiao, Zhuoyan Luo, Yong Liu, Yue Ma, Hengwei Bian, Yatai Ji, Yujiu Yang, Xiu Li

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13752 2023-11-27 cs.CV cs.AI 62%

3D-MIR: A Benchmark and Empirical Study on 3D Medical Image Retrieval in Radiology

Asma Ben Abacha, Alberto Santamaria-Pang, Ho Hin Lee, Jameson Merkow, Qin Cai, Surya Teja Devarakonda, Abdullah Islam, Julia Gong, Matthew P. Lungren, Thomas Lin, Noel C Codella, Ivan Tarapov

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.10859 2023-11-15 cs.LG cs.AI cs.CV stat.ML 62%

Visualizing the Diversity of Representations Learned by Bayesian Neural Networks

Dennis Grinwald, Kirill Bykov, Shinichi Nakajima, Marina M. -C. Höhne

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 16 pages, 18 figures

Journal ref Published in Transactions on Machine Learning Research (11/2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.00282 2023-11-13 cs.CV cs.IR cs.MM 62%

(Un)likelihood Training for Interpretable Embedding

Jiaxin Wu, Chong-Wah Ngo, Wing-Kwong Chan, Zhijian Hou

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments accepted in ACM Transactions on Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏