arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3475 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3475 篇

1504.02265 2015-04-13 q-bio.NC nlin.AO physics.soc-ph 78%

An Algebraic Topological Method for Multimodal Brain Networks Comparisons

Tiago Simas, Mario Chavez, Pablo Rodriguez, Albert Diaz-Guilera

专题命中 跨模态检索 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1503.07906 2015-03-30 cs.LG stat.ML 78%

Generalized K-fan Multimodal Deep Model with Shared Representations

Gang Chen, Sargur N. Srihari

专题命中 跨模态检索 :multimodal(title,abstract)

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 77%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(abstract,abstract_cn);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20291 2026-07-23 cs.CV 新提交 77%

Diverse-Intent Multi-Turn Fashion Image Retrieval

多样化意图的多轮时尚图像检索

Mingqiang Tang, Haokun Wen, Meng Liu, Yupeng Hu, Weili Guan, Xuemeng Song

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究现实世界时尚多轮图像检索问题,提出FashionAM框架直接对齐多模态对话查询与时尚图库嵌入空间,避免文本化,引入DIM-Fashion数据集,实验证明该框架优于现有方法,数据集和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05901 2026-07-08 cs.AI 新提交 77%

Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking

通过优势加权排序揭示二元抑郁检测中的潜在抑郁严重程度

Manning Gao, Tingyi Liu, Leheng Zhang, Haifeng Hu, Yuncheng Jiang, Sijie Mai

机构 * South China Normal University(华南师范大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI

AI总结 研究利用视听数据检测抑郁的挑战,提出含时间编码器和相互变压器的多模态框架,核心是二元优势加权排序损失,通过两种机制优化潜在空间分布,实验表明该模型重建潜在有序结构,性能达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00060 2026-07-02 cs.CV 新提交 77%

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础

Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Anhui University(安徽大学)

专题命中 跨模态检索 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV

AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。

Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00263 2026-07-01 cs.CV cs.LG cs.NE 版本更新 77%

Room Scene Discovery and Grouping in Unstructured Vacation Rental Image Collections

非结构化度假租赁图像集合中的房间场景发现与分组

Vignesh Ram Nithin Kappagantula, Shayan Hassantabar

机构 * Expedia Group(Expedia集团)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 针对度假租赁平台图片缺乏结构化分类的问题,提出一种低延迟、样本高效的机器学习流水线,通过监督式房间类型检测、重叠检测和聚类算法实现房间分组,并利用多模态大语言模型识别床型,显著优于对比学习和预训练嵌入聚类方法。

Comments Presented at the Two-sided Marketplace Optimization Workshop, KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23539 2026-06-23 cs.CV 新提交 77%

LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

LightSTAR: 通过视觉自适应精炼的轻量级选择实现高效视觉文档检索

Tongkun Guan, Haocheng Wang, Wei Shen, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院教育部人工智能重点实验室)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 提出LightSTAR框架,通过免LLM的视觉选择快速筛选候选页,再经视觉自适应语义精炼进行细粒度匹配,在保持高检索精度的同时大幅降低延迟。

Comments Accpeted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08976 2026-06-16 cs.CV cs.DC cs.IR 版本更新 77%

MIRAGE: Runtime Scheduling for Multi-Vector Image Retrieval with Hierarchical Decomposition

MIRAGE:基于层次分解的多向量图像检索运行时调度

Maoliang Li, Ke Li, Yaoyang Liu, Jiayu Chen, Zihao Zheng, Yinjun Wu, Chenchen Liu, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Information, Renmin University of China(中国人民大学信息学院) School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出MIRAGE框架,通过层次化分解和跨层次相似性一致性减少冗余计算,实现多向量图像检索的精度提升和3.5倍计算加速。

Comments Will appear in DAC'2026, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12294 2026-06-11 cs.CV eess.IV 新提交 77%

Bridging the Modality Gap in Forensic Image Retrieval

弥合法医图像检索中的模态差距

Ricardo González-Gazapo, Annette Morales-González, Yoanna Martínez-Díaz, Heydi Méndez-Vázquez, Milton García-Borroto

机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。

Comments 23 pages, 5 figures, paper submitted to Elsevier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03470 2026-06-03 cs.CV 77%

Mixed-Modality Dual Face-Hair Retrieval

混合模态双人脸-发型检索

Quoc-Anh Bui-Huynh, Mai-Tuyen Lam, Dai-Anh-Tuan Nguyen, Thanh Duc Ngo

机构 * Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南) University of Information Technology, VNU-HCM, Ho Chi Minh City, Vietnam(信息技术大学,VNU-HCM,胡志明市,越南)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出混合模态双参考检索任务DFHR,通过解耦身份与发型特征并融合多模态嵌入,实现跨模态的身份感知与属性可控检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06484 2026-06-01 cs.CL 77%

ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs

ValueGround: 评估多模态大语言模型中文化条件化的视觉价值基础

Zhipin Wang, Christoph Leiter, Christian Frey, Mohamed Hesham Ibrahim Abdalla, Josif Grabocka, Steffen Eger

机构 * University of Technology Nuremberg (UTN)(图恩大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.CL

AI总结 提出ValueGround基准,通过最小对比图像对评估多模态大语言模型在文化条件化视觉价值判断中的表现,发现模型在可视化选项下准确率显著低于文本选项。

Comments Updated preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27449 2026-05-28 cs.IR cs.AI 77%

Checking Fact with Better Retrieval: Dynamic Contrastive Learning for Evidence Retrieval

用更好的检索核查事实:用于证据检索的动态对比学习

Zhongtian Hua, Yi Luo, Meijia Yu, Yingjie Han

机构 * Zhengzhou University(郑州大学) Henan University of Science and Technology(河南科技大学)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 提出动态自适应对比学习方法DACLR,通过事件级特征提取、两阶段检索和动态对比损失优化,提升多模态证据检索的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14928 2026-05-15 cs.CL 77%

Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA

过程链:用于过程问答的层次视觉语言推理

Guanhua Chen, Yutong Yao, Shenghe Sun, Ci-Jun Gao, Shudong Liu, Lidia S. Chao, Feng Wan, Derek F. Wong

机构 * NLP CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学CT实验室) Department of Electrical and Computer Engineering, University of Macau(电气与计算机工程系,澳门大学) Centre for Cognitive and Brain Sciences, University of Macau(认知与脑科学中心,澳门大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CL

AI总结 本文提出ProcedureVQA基准,针对视觉过程问答任务,通过过程链框架解决现有VLMs在跨模态检索和步骤分解上的不足,实验显示其在六个VLMs上提升达13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13511 2026-05-04 cs.CV cs.IR 77%

Adapting MLLMs for Nuanced Video Retrieval

为精细化视频检索适应大语言模型

Piyush Bagad, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种统一嵌入模型,通过对比损失微调文本训练的多模态大语言模型,以处理视频检索中的时间、否定和多模态细微差别,实现最先进的检索性能。

Comments 38 Pages. Project page at http://bpiyush.github.io/tara-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12193 2026-04-20 cs.CV 77%

VeRVE: Versatile Retrieval for Videos via Unified Embeddings

VeRVE:通过统一嵌入实现视频的多功能检索

Shaunak Halbe, Bhagyashree Puranik, Jayakrishnan Unnikrishnan, Kushan Thakkar, Vimal Bhat, Toufiq Parag

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) Keystone AI

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15946 2026-04-17 cs.LG cs.AI cs.CR 77%

Fall into a Pit, Gain in a Wit: Cognitive-Guided Harmful Meme Detection via Misjudgment Risk Pattern Retrieval

跌入陷阱,获得智慧:通过误判风险模式检索的认知引导有害迷因检测

Wenshuo Wang, Ziyou Jiang, Junjie Wang, Mingyang Li, Jie Huang, Yuekai Huang, Zhiyuan Chang, Feiyan Duan, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory(集成信息系统技术研究所) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出PatMD方法,通过学习并主动缓解潜在误判风险,识别有害迷因的深层误判风险模式,提升多模态大语言模型的检测能力,实验显示在5项有害检测任务中,F1-score和准确率均显著提升。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08003 2025-10-10 cs.CV 77%

CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning

Weihuang Lin, Yiwei Ma, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12819 2025-07-18 cs.CV 77%

MCoT-RE: Multi-Faceted Chain-of-Thought and Re-Ranking for Training-Free Zero-Shot Composed Image Retrieval

Jeong-Woo Park, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

Comments 6 pages, 4 figures, 2025 IEEE International Conference on Systems, Man, and Cybernetics

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12378 2025-07-17 cs.IR cs.CL 77%

Developing Visual Augmented Q&A System using Scalable Vision Embedding Retrieval & Late Interaction Re-ranker

Rachna Saxena, Abhijeet Kumar, Suresh Shanmugam

专题命中 跨模态检索 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CL

Comments Presented at NLP@IR workshop at SIGIR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08958 2023-02-20 cs.CV 77%

Towards Unifying Medical Vision-and-Language Pre-training via Soft Prompts

Zhihong Chen, Shizhe Diao, Benyou Wang, Guanbin Li, Xiang Wan

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.07364 2018-07-20 cs.CV 77%

Revisiting Cross Modal Retrieval

Shah Nawaz, Muhammad Kamran Janjua, Alessandro Calefati, Ignazio Gallo

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments 14 pages. Under review at ECCVW (MULA 2018)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19536 2026-08-21 cs.CV cs.AI cs.RO 新提交 76%

CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

CVSD-Reg:用于鲁棒激光雷达配准的跨模态视觉语义先验蒸馏

Eunsoo Im, Junghun Suh, Gyeonggwan Lee, Seunghwan Hong

专题命中 跨模态检索 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出CVSD-Reg框架,通过蒸馏视觉基础模型的语义先验提升激光雷达配准的鲁棒性,在多数据集上的成功率优于现有方法,且无需相机输入或事后ICP精修。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14264 2026-07-17 cs.CV cs.CL 新提交 76%

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理

Yi Lin, Yihao Ding, Elana Benishay, Elefterios Trikantzopoulos, David Nauheim, Hanley Ong, Jiang Bian, Hua Xu, Yuzhe Yang, George Shih, Yifan Peng

机构 * Weill Cornell Medicine(威尔康乃尔医学院) University of Western Australia(西澳大利亚大学) Indiana University(印第安纳大学) Regenstrief Institute(瑞根斯特里夫研究所) Yale University(耶鲁大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.CL

AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24530 2026-05-26 cs.CL cs.CV 76%

Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval

Unveil: 统一视觉-文本集成与蒸馏的多模态文档检索

Hao Sun, Yingyan Hou, Jiayan Guo, Bo Wang, Chunyu Yang, Jinsong Ni, Yan Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京理工大学通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Key Laboratory of Target Cognition and Application Technology(目标认知与应用技术重点实验室) Beijing Institute of Technology(北京理工大学) Ucap Cloud(Ucap云)

专题命中 跨模态检索 :multi-modal(title);分类 cs.CV、cs.CL

AI总结 提出Unveil框架,通过视觉-文本嵌入和知识蒸馏实现鲁棒的文档检索,兼顾布局与语义信息。

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23709 2026-01-23 cs.CV cs.AI cs.LG 76%

Skin Lesion Phenotyping via Nested Multi-modal Contrastive Learning

通过嵌套多模态对比学习进行皮肤病变表型分析

Dionysis Christopoulos, Sotiris Spanos, Eirini Baltzi, Valsamis Ntouskos, Konstantinos Karantzalos

专题命中 跨模态检索 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 SLIMP通过嵌套多模态对比学习,结合图像与元数据提升皮肤病变分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14154 2026-01-21 cs.CV cs.AI 76%

LLM Augmented Intervenable Multimodal Adaptor for Post-operative Complication Prediction in Lung Cancer Surgery

基于大语言模型的可干预多模态适配器用于肺癌手术后并发症预测

Shubham Pandey, Bhavin Jawade, Srirangaraj Setlur, Venu Govindaraju, Kenneth Seastedt

机构 * University at Buffalo(布法罗大学) Roswell Park Comprehensive Cancer Center(罗斯威尔帕克综合癌症中心)

专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.AI

AI总结 MIRACLE通过整合术前临床和放射学数据,利用超球面嵌入空间和干预式深度学习模块,实现肺癌手术后并发症风险的预测与可解释性管理。

Comments Accepted to P2P-CV @ WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19864 2025-12-29 cs.CL cs.AI 76%

HARMON-E: Hierarchical Agentic Reasoning for Multimodal Oncology Notes to Extract Structured Data

HARMON-E:多模态肿瘤病历的分层代理推理以提取结构化数据

Shashi Kant Gupta, Arijeet Pramanik, Jerrin John Thomas, Regina Schwind, Lauren Wiener, Avi Raju, Jeremy Kornbluth, Yanshan Wang, Zhaohui Su, Hrituraj Singh

机构 * Triomics University of Pittsburgh(匹兹堡大学) Ontada

专题命中 跨模态检索 :multimodal(title);分类 cs.CL、cs.AI

AI总结 HARMON-E通过分层代理推理框架,实现对多模态肿瘤病历的结构化数据提取,达到高精度和大规模应用。

Comments 39 Pages, Supplementary Included

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10266 2025-10-30 cs.CV cs.AI 76%

SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion

Wenfang Wu, Tingting Yuan, Yupeng Li, Daling Wang, Xiaoming Fu

专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13888 2025-09-18 cs.CL cs.AI cs.IR 76%

Combating Biomedical Misinformation through Multi-modal Claim Detection and Evidence-based Verification

Mariano Barone, Antonio Romano, Giuseppe Riccio, Marco Postiglione, Vincenzo Moscato

机构 * University of Naples Federico II(那不勒斯费迪里奇二世大学) Northwestern University(西北大学)

专题命中 跨模态检索 :multi-modal(title);分类 cs.CL、cs.AI

Journal ref SIGIR '25: Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏