arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3496 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3496 篇

2410.02746 2025-02-20 cs.CV cs.LG 57%

Contrastive Localized Language-Image Pre-Training

Hong-You Chen, Zhengfeng Lai, Haotian Zhang, Xinze Wang, Marcin Eichner, Keen You, Meng Cao, Bowen Zhang, Yinfei Yang, Zhe Gan

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11431 2025-02-18 cs.CL 57%

Any Information Is Just Worth One Single Screenshot: Unifying Search With Visualized Information Retrieval

Ze Liu, Zhengyang Liang, Junjie Zhou, Zheng Liu, Defu Lian

机构 * BAAI(北京智源人工智能研究院) USTC(中国科学技术大学) BUPT(北京邮电大学) HKPU(香港理工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01476 2025-02-14 cs.DB cs.AI cs.LG 57%

Optimizing Context-Enhanced Relational Joins

Viktor Sanca, Manos Chatzakis, Anastasia Ailamaki

机构 * EPFL(洛桑联邦理工学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08254 2025-02-13 cs.CV 57%

UniCoRN: Unified Commented Retrieval Network with LMMs

Maximilian Jaritz, Matthieu Guillaumin, Sabine Sternig, Loris Bazzani

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06385 2025-02-11 cs.CV 57%

AMNS: Attention-Weighted Selective Mask and Noise Label Suppression for Text-to-Image Person Retrieval

Runqing Zhang, Xue Zhou

机构 * Shenzhen Institute for Advanced Study(深圳高等研究院) University of Electronic Science and Technology of China(电子科技大学)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20592 2025-02-11 cs.LG cs.AI 57%

LInK: Learning Joint Representations of Design and Performance Spaces through Contrastive Learning for Mechanism Synthesis

Amin Heyrani Nobari, Akash Srivastava, Dan Gutfreund, Kai Xu, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

Journal ref Transactions on Machine Learning Research, 2835-885, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14826 2025-01-28 cs.IR cs.AI cs.LG 57%

Multi-Modality Transformer for E-Commerce: Inferring User Purchase Intention to Bridge the Query-Product Gap

Srivatsa Mallapragada, Ying Xie, Varsha Rani Chawan, Zeyad Hailat, Yuanbo Wang

机构 * Kennesaw State University(肯尼索州立大学) The Home Depot, Inc(家得宝公司)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

Comments Published in IEEE Big Data Conference 2024, Washington DC

Journal ref 2024 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14101 2025-01-27 cs.CV 57%

StreamingRAG: Real-time Contextual Retrieval and Generation Framework

Murugan Sankaradas, Ravi K. Rajendran, Srimat T. Chakradhar

机构 * NEC Laboratories America(美国 NEC 实验室)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

Comments Accepted and Presented at AI4Sys, HPDC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10787 2025-01-22 cs.CV cs.IR cs.LG 57%

LD-DETR: Loop Decoder DEtection TRansformer for Video Moment Retrieval and Highlight Detection

Pengcheng Zhao, Zhixian He, Fuwei Zhang, Shujin Lin, Fan Zhou

机构 * Sun Yat-Sen University(中山大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03337 2025-01-17 cs.HC cs.AI cs.CY cs.LG 57%

PsyDI: Towards a Personalized and Progressively In-depth Chatbot for Psychological Measurements

Xueyan Li, Xinyan Chen, Yazhe Niu, Shuai Hu, Yu Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) SenseTime Research(商汤科技研究院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03535 2025-01-09 cs.AI cs.RO 57%

SenseRAG: Constructing Environmental Knowledge Bases with Proactive Querying for LLM-Based Autonomous Driving

Xuewen Luo, Fan Ding, Fengze Yang, Yang Zhou, Junnyong Loo, Hwa Hui Tew, Chenxi Liu

机构 * School of Information Technology, Monash University(莫纳什大学信息技术学院) University of Utah(犹他大学) Texas A&M University(德克萨斯农工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

Comments This paper has been accepted for presentation at WACV Workshop LLMAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17624 2025-01-08 q-fin.RM cs.CL q-fin.GN 57%

Forecasting Credit Ratings: A Case Study where Traditional Methods Outperform Generative LLMs

Felix Drinkall, Janet B. Pierrehumbert, Stefan Zohren

机构 * University of Oxford(牛津大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04614 2024-12-24 cs.CV 57%

HST-MRF: Heterogeneous Swin Transformer with Multi-Receptive Field for Medical Image Segmentation

Xiaofei Huang, Hongfang Gong, Jin Zhang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Journal ref IEEE Journal of Biomedical and Health Informatics, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11077 2024-12-23 cs.CV 57%

Reason-before-Retrieve: One-Stage Reflective Chain-of-Thoughts for Training-Free Zero-Shot Composed Image Retrieval

Yuanmin Tang, Xiaoting Qin, Jue Zhang, Jing Yu, Gaopeng Gou, Gang Xiong, Qingwei Ling, Saravan Rajmohan, Dongmei Zhang, Qi Wu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03487 2024-12-18 cs.CV 57%

ScreenMark: Watermarking Arbitrary Visual Content on Screen

Xiujian Liang, Gaozhi Liu, Yichao Si, Xiaoxiao Hu, Zhenxing Qian

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12079 2024-12-17 cs.CV 57%

UniLoc: Towards Universal Place Recognition Using Any Single Modality

Yan Xia, Zhendong Li, Yun-Jin Li, Letian Shi, Hu Cao, João F. Henriques, Daniel Cremers

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11818 2024-12-17 cs.MM cs.IR 57%

Leveraging User-Generated Metadata of Online Videos for Cover Song Identification

Simon Hachmeier, Robert Jäschke

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.MM

Comments accepted for presentation at NLP for Music and Audio (NLP4MusA) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11396 2024-12-17 cs.CV 57%

Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes

Antonio Carlos Rivera, Anthony Moore, Steven Robinson

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10624 2024-12-17 cs.CV cs.LG 57%

CATALOG: A Camera Trap Language-guided Contrastive Learning Model

Julian D. Santamaria, Claudia Isaza, Jhony H. Giraldo

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09445 2024-12-13 eess.IV cs.CV 57%

Embeddings are all you need! Achieving High Performance Medical Image Classification through Training-Free Embedding Analysis

Raj Hansini Khoiwal, Alan B. McMillan

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments 15 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07782 2024-12-13 eess.IV cs.CV 57%

Exploring Masked Autoencoders for Sensor-Agnostic Image Retrieval in Remote Sensing

Jakob Hackstein, Gencer Sumbul, Kai Norman Clasen, Begüm Demir

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Accepted at the IEEE Transactions on Geoscience and Remote Sensing. Our code is available at https://github.com/jakhac/CSMAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08406 2024-12-12 cs.CV 57%

Embedding and Enriching Explicit Semantics for Visible-Infrared Person Re-Identification

Neng Dong, Shuanglin Yan, Liyan Zhang, Jinhui Tang

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05937 2024-12-10 cs.LG cs.AI cs.IR cs.MA 57%

Accelerating Manufacturing Scale-Up from Material Discovery Using Agentic Web Navigation and Retrieval-Augmented AI for Process Engineering Schematics Design

Sakhinana Sagar Srinivas, Akash Das, Shivam Gupta, Venkataramana Runkana

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05274 2024-12-09 cs.CV 57%

SimC3D: A Simple Contrastive 3D Pretraining Framework Using RGB Images

Jiahua Dong, Tong Wu, Rui Qian, Jiaqi Wang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04828 2024-12-09 cs.CV 57%

DAug: Diffusion-based Channel Augmentation for Radiology Image Retrieval and Classification

Ying Jin, Zhuoran Zhou, Haoquan Fang, Jenq-Neng Hwang

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09566 2024-12-09 cs.CV cs.HC 57%

Bridging Text and Image for Artist Style Transfer via Contrastive Learning

Zhi-Song Liu, Li-Wen Wang, Jun Xiao, Vicky Kalogeiton

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments 18 pages, 8 figures. arXiv admin note: substantial text overlap with arXiv:2202.13562

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12735 2024-12-03 cs.CV 57%

EchoSight: Advancing Visual-Language Models with Wiki Knowledge

Yibin Yan, Weidi Xie

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted by EMNLP 2024 findings; Project Page: https://go2heart.github.io/echosight

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00440 2024-12-03 cs.CV 57%

Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training

Haicheng Wang, Chen Ju, Weixiong Lin, Shuai Xiao, Mengting Chen, Yixuan Huang, Chang Liu, Mingshuai Yao, Jinsong Lan, Ying Chen, Qingwen Liu, Yanfeng Wang

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09979 2024-12-02 cs.MM 57%

Self-Training Boosted Multi-Factor Matching Network for Composed Image Retrieval

Haokun Wen, Xuemeng Song, Jianhua Yin, Jianlong Wu, Weili Guan, Liqiang Nie

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 46, no. 5, pp. 3665-3678, May 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16082 2024-11-26 cs.CV 57%

Leverage Task Context for Object Affordance Ranking

Haojie Huang, Hongchen Luo, Wei Zhai, Yang Cao, Zheng-Jun Zha

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏