arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3475 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3475 篇

2503.12485 2025-03-24 cs.CV 79%

Cross-Modal Consistency Learning for Sign Language Recognition

Kepeng Wu, Zecheng Li, Hezhen Hu, Wengang Zhou, Houqiang Li

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13862 2025-03-19 cs.CV cs.LG 79%

HySurvPred: Multimodal Hyperbolic Embedding with Angle-Aware Hierarchical Contrastive Learning and Uncertainty Constraints for Survival Prediction

Jiaqi Yang, Wenting Chen, Xiaohan Xing, Sean He, Xiaoling Luo, Xinheng Lyu, Linlin Shen, Guoping Qiu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Comments submitted to IJCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10526 2025-03-14 cs.CV 79%

NeighborRetr: Balancing Hub Centrality in Cross-Modal Retrieval

Zengrong Lin, Zheng Wang, Tianwen Qian, Pan Mu, Sixian Chan, Cong Bai

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2025, 18 pages, 7 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19751 2025-03-03 cs.CV 79%

Lightweight Contrastive Distilled Hashing for Online Cross-modal Retrieval

Jiaxing Li, Lin Jiang, Zeqi Ma, Kaihang Jiang, Xiaozhao Fang, Jie Wen

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11742 2025-03-03 cs.CV 79%

Range and Bird's Eye View Fused Cross-Modal Visual Place Recognition

Jianyi Peng, Fan Lu, Bin Li, Yuan Huang, Sanqing Qu, Guang Chen

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17470 2025-02-28 eess.SP cs.AI 79%

MC2SleepNet: Multi-modal Cross-masking with Contrastive Learning for Sleep Stage Classification

Younghoon Na, Hyun Keun Ahn, Hyun-Kyung Lee, Yoongeol Lee, Seung Hun Oh, Hongkwon Kim, Jeong-Gun Lee

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19128 2025-02-27 cs.CV 79%

SCA3D: Enhancing Cross-modal 3D Retrieval via 3D Shape and Caption Paired Data Augmentation

Junlong Ren, Hao Wu, Hui Xiong, Hao Wang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13277 2025-02-27 cs.LG cs.AI 79%

HyperGCL: Multi-Modal Graph Contrastive Learning via Learnable Hypergraph Views

Khaled Mohammed Saifuddin, Shihao Ji, Esra Akbas

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.AI

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16451 2025-02-25 cs.CL 79%

Contrastive Learning of English Language and Crystal Graphs for Multimodal Representation of Materials Knowledge

Yang Jeong Park, Mayank Kumaran, Chia-Wei Hsu, Elsa Olivetti, Ju Li

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract);分类 cs.CL

Comments 24 pages, 14 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13732 2025-02-25 cs.CV 79%

Modeling Multi-modal Cross-interaction for Multi-label Few-shot Image Classification Based on Local Feature Selection

Kun Yan, Zied Bouraoui, Fangyun Wei, Chang Xu, Ping Wang, Shoaib Jameel, Steven Schockaert

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments In Transactions on Multimedia Computing Communications and Applications. arXiv admin note: text overlap with arXiv:2112.01037

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04616 2025-02-24 cs.CL 79%

Can LLMs Improve Multimodal Fact-Checking by Asking Relevant Questions?

Alimohammad Beigi, Bohan Jiang, Dawei Li, Zhen Tan, Pouya Shaeri, Tharindu Kumarage, Amrita Bhattacharjee, Huan Liu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13954 2025-02-20 cs.CL cs.LG 79%

Latent Distribution Decoupling: A Probabilistic Framework for Uncertainty-Aware Multimodal Emotion Recognition

Jingwang Huang, Jiang Zhong, Qin Lei, Jinpeng Gao, Yuming Yang, Sirui Wang, Peiguang Li, Kaiwen Wei

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11633 2025-02-18 cs.CL 79%

CLASS: Enhancing Cross-Modal Text-Molecule Retrieval Performance and Training Efficiency

Hongyan Wu, Peijian Zeng, Weixiong Zheng, Lianxi Wang, Nankai Lin, Shengyi Jiang, Aimin Yang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CL

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10704 2025-02-12 cs.CL 79%

VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation

Manan Suri, Puneet Mathur, Franck Dernoncourt, Kanika Goswami, Ryan A. Rossi, Dinesh Manocha

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07121 2025-02-11 cs.LG cs.CL 79%

Bridging the Gap for Test-Time Multimodal Sentiment Analysis

Zirun Guo, Tao Jin, Wenlong Xu, Wang Lin, Yangyang Wu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08521 2025-02-10 cs.IR cs.CL 79%

MuRAR: A Simple and Effective Multimodal Retrieval and Answer Refinement Framework for Multimodal Question Answering

Zhengyuan Zhu, Daniel Lee, Hong Zhang, Sai Sree Harsha, Loic Feujio, Akash Maharaj, Yunyao Li

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01074 2025-02-03 cs.CV 79%

AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis

Qiuhui Chen, Yi Hong

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.CV

Comments BIBM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19540 2025-01-31 cs.LG cs.AI 79%

Overcoming Uncertain Incompleteness for Robust Multimodal Sequential Diagnosis Prediction via Curriculum Data Erasing Guided Knowledge Distillation

Heejoon Koo

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

Comments Accepted by ICASSP 2025 (2025 IEEE International Conference on Acoustics, Speech, and Signal Processing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07304 2025-01-14 cs.CV cs.LG 79%

Code and Pixels: Multi-Modal Contrastive Pre-training for Enhanced Tabular Data Analysis

Kankana Roy, Lars Krämer, Sebastian Domaschke, Malik Haris, Roland Aydin, Fabian Isensee, Martin Held

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04695 2025-01-09 cs.LG cs.CV cs.IR cs.IT math.IT 79%

Re-ranking the Context for Multimodal Retrieval Augmented Generation

Matin Mortaheb, Mohammad A. Amir Khojastepour, Srimat T. Chakradhar, Sennur Ulukus

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03995 2025-01-08 cs.LG cs.CV cs.IR cs.IT math.IT 79%

RAG-Check: Evaluating Multimodal Retrieval Augmented Generation Performance

Matin Mortaheb, Mohammad A. Amir Khojastepour, Srimat T. Chakradhar, Sennur Ulukus

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01066 2025-01-03 cs.MM 79%

DiffCL: A Diffusion-Based Contrastive Learning Framework with Semantic Alignment for Multimodal Recommendations

Qiya Song, Jiajun Hu, Lin Xiao, Bin Sun, Xieping Gao, Shutao Li

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13069 2024-12-30 cs.CV cs.LG 79%

General-Purpose Multi-Modal OOD Detection Framework

Viet Duong, Qiong Wu, Zhengyi Zhou, Eric Zavesky, Jiahe Chen, Xiangzhou Liu, Wen-Ling Hsu, Huajie Shao

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Journal ref Transactions on Machine Learning Research 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14880 2024-12-20 cs.CV 79%

Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering

Peize Li, Qingyi Si, Peng Fu, Zheng Lin, Yan Wang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13834 2024-12-19 cs.IR cs.AI cs.LG 79%

Maybe you are looking for CroQS: Cross-modal Query Suggestion for Text-to-Image Retrieval

Giacomo Pacini, Fabio Carrara, Nicola Messina, Nicola Tonellotto, Giuseppe Amato, Fabrizio Falchi

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.AI

Comments 15 pages, 5 figures. To be published as full paper in the Proceedings of the European Conference on Information Retrieval (ECIR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05843 2024-12-10 cs.CL cs.LG 79%

A Self-Learning Multimodal Approach for Fake News Detection

Hao Chen, Hui Guo, Baochen Hu, Shu Hu, Jinrong Hu, Siwei Lyu, Xi Wu, Xin Wang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00756 2024-12-10 cs.CL 79%

Multi-View Incongruity Learning for Multimodal Sarcasm Detection

Diandian Guo, Cong Cao, Fangfang Yuan, Yanbing Liu, Guangjie Zeng, Xiaoyan Yu, Hao Peng, Philip S. Yu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05155 2024-12-09 cs.CL 79%

Multimodal Fact-Checking with Vision Language Models: A Probing Classifier based Solution with Embedding Strategies

Recep Firat Cekinel, Pinar Karagoz, Cagri Coltekin

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06220 2024-12-05 cs.LG cs.MM 79%

Zero-Shot Relational Learning for Multimodal Knowledge Graphs

Rui Cai, Shichao Pei, Xiangliang Zhang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

Comments In the Proceedings of the 2024 IEEE International Conference on Big Data (IEEE BigData 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01299 2024-12-03 cs.CV cs.RO 79%

Cross-Modal Visual Relocalization in Prior LiDAR Maps Utilizing Intensity Textures

Qiyuan Shen, Hengwang Zhao, Weihao Yan, Chunxiang Wang, Tong Qin, Ming Yang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏