arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3463 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3463 篇

2605.14113 2026-05-29 cs.CV cs.AI cs.LG cs.MA 81%

ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows

ProtoMedAgent: 通过隐私感知的智能体工作流实现多模态临床可解释性

Alvaro Lopez Pellicer, Plamen Angelov, Marwan Bukhari, Yi Li, Eduardo Soares, Jemma Kerns

机构 * School of Computing and Communications(计算与通信学校) Lancaster University(兰卡斯特大学) Lancaster Medical School(兰卡斯特医学院) PUC-Rio(里约热内卢联邦大学) Puc-Behring Institute for AI(人工智能皮克林研究所)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ProtoMedAgent框架,通过神经符号瓶颈和反射性Scribe-Critic循环约束生成过程,解决原型网络在临床报告中的语义结构缺失和检索谄媚问题,并引入k-匿名和ℓ-多样性隐私门控。

Comments CVR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24037 2026-05-26 cs.CV cs.AI 81%

Mode-as-Sequence: Translating Multimodal Motion Prediction into Unified Sequential Mode Modeling

模式即序列:将多模态运动预测转化为统一序列模式建模

Zikang Zhou, Haibo Hu, Xinhong Chen, Yifan Zhang, Nan Guan, Yung-Hui Li, Chun Jason Xue, Jianping Wang

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Hon Hai Research Institute(富士康研究学院) Mohamed bin Zayed University of Artificial Intelligence(莫莫丁·宾·扎耶德人工智能大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Mode-as-Sequence框架,将无序模式集转化为有序模式序列并显式建模模式间依赖,通过ModeSeq和Parallel ModeSeq两种实例化方法解决多模态运动预测中的模式坍塌和置信度排序问题,在Waymo数据集上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14822 2026-05-20 cs.CV cs.AI 81%

Multimodal system for skin cancer detection

多模态皮肤癌检测系统

Volodymyr Sydorskyi, Igor Krashenyi, Oleksii Yakubenko

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态皮肤癌检测系统,结合传统照片图像与表格型元数据(如患者人口统计数据和病变特征),通过多模态神经网络和两阶段模型提升检测准确率,并通过三阶段流程进一步优化预测,最终在不平衡数据集上实现显著性能提升。

Comments Accepted to System research and information technologies

Journal ref System Research and Information Technologies, no. 1, pp. 33-57, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14787 2026-05-19 cs.CV cs.CL 81%

Do Composed Image Retrieval Benchmarks Require Multimodal Composition?

组合图像检索基准是否需要多模态组合?

Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo, Alessandro Suglia, Dietmar Jannach, Tommaso Di Noia, Pasquale Minervini

机构 * Politecnico di Bari(巴里理工大学) Sapienza University of Rome(罗马萨皮恩扎大学) University of Edinburgh(爱丁堡大学) University of Klagenfurt(克雷格弗特大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究发现组合图像检索任务中,许多查询可通过单一模态解决,而非真正的多模态组合,揭示了多模态组合的假设不成立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15168 2026-05-15 cs.CL cs.AI cs.LG stat.ML 81%

Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

文本知晓什么,表格知晓何时:通过检索增强的多模态对齐进行临床时间线重建

Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim, Jeremy C. Weiss

机构 * National Library of Medicine National Institutes of Health(国家医学图书馆国立卫生研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种检索增强的多模态对齐框架,通过结合文本和结构化EHR数据,提高临床时间线的精确度,提升时间一致性,同时保持事件匹配率。

Comments Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim (authors contributed equally)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14448 2026-05-15 cs.CV cs.CL cs.IR 81%

Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture

需要时思考:基于双LoRA架构的自适应推理驱动多模态嵌入

Longxiang Zhang, Weilong Dai, Guanghao Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出TWN框架,通过双LoRA架构和自适应推理机制,提升多模态嵌入效率与质量,在78个任务中达到SOTA水平,参数更少,推理成本更低。

Comments 30 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08887 2026-05-12 cs.AI cs.CL 81%

Ace-Skill: Bootstrapping Multimodal Agents with Prioritized and Clustered Evolution

Ace-Skill:通过优先级和聚类进化提升多模态智能体

Feng Xiong, Zengbin Wang, Yong Wang, Xuecai Hu, Jinghan He, Liang Lin, Yuan Liu, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) CASIA BNU(北华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 Ace-Skill通过优先级采样和聚类组织优化多模态智能体的自我进化过程,提升信息获取效率和知识检索可靠性,实现自我强化的良性循环,提升多模态工具使用任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07655 2026-05-11 cs.CV cs.AI 81%

Towards Billion-scale Multi-modal Biometric Search

迈向十亿级多模态生物特征搜索

Arka Koner, Chetan S. Naik, Lokesh Kurre, Vivek Raghavan, Barada P. Sabut, Tanusree Deb Barma, Anoop M. Namboodiri, Anil K. Jain

机构 * Unique Identification Authority of India(印度唯一身份权威机构) IIIT Hyderabad(海得拉巴IIIT) Michigan State University(密歇根州立大学)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Bharat ABIS系统,通过多模态预处理和特征提取实现十亿级生物特征库的1:N搜索,验证了其在印度Aadhaar数据库上的高效性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05594 2026-05-08 cs.CL cs.CV cs.LG 81%

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

上下文的成本:减轻多模态检索增强生成中的文本偏差

Hoin Jung, Xiaoqian Wang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫夫家族电气与计算机工程学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文探讨了多模态大语言模型在整合检索增强生成时出现的文本偏差问题,提出BAIR方法通过恢复视觉显著性并施加位置感知惩罚来提升多模态接地和诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23195 2026-04-28 cs.CV cs.AI 81%

AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval

AnalogRetriever: 为模拟电路检索学习跨模态表示

Yihan Wang, Lei Li, Yao Lai, Jing Wang, Yan Lu

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Cambridge(剑桥大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。

Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22885 2026-04-28 cs.CV cs.AI 81%

Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization

联邦跨模态检索与缺失模态的语义路由和适配器个性化

Hefeng Zhou, Xuan Liu, Sicheng Chen, Wutong Zhang, Wu Yan, Jiong Lou, Chentao Wu, Guangtao Xue, Wei Zhao, Jie Li

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-鲁克桑克鲁特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) Shaanghai Jiao Tong University(上海交通大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出RCSR框架,通过语义路由和适配器个性化解决联邦跨模态检索中异构数据和缺失模态的问题,提升全局检索准确性和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20878 2026-04-24 cs.CL cs.CV cs.LG eess.IV 81%

AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models

AITP:通过多模态大语言模型进行交通事故责任分配

Zijin Zhou, Songan Zhang

机构 * Global Institute of Future Technology(未来技术全球研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出AITP模型,结合多模态链式推理和法律知识检索,解决交通事故责任分配问题,并构建DecaTARA基准测试集,验证模型在责任分配、事故检测和理解任务中的领先性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00798 2026-04-23 cs.CV cs.AI 81%

Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering

逐步多模态搜索与推理用于知识密集型视觉问答

Changin Choi, Wonseok Lee, Jungmin Ko, Wonjong Rhee

机构 * Interdisciplinary Program in Artificial Intelligence(人工智能交叉学科项目) Department of Intelligence and Information(智能与信息系) Samsung Advanced Institute of Technology(三星先进技术研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出PMSR框架,通过逐步构建结构化推理轨迹提升知识获取与综合能力,实验显示在六个基准测试中提升了检索召回率和端到端回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19093 2026-04-22 cs.CV cs.AI 81%

Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibration

多模态测试时适应 via 自适应概率高斯校准

Jinglin Xu, Yi Li, Chuxiong Sun, Xiao Xu, Jiangmeng Li, Fanjiang Xu

机构 * Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) National Defense University(国防大学)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应概率高斯校准方法,解决多模态测试时适应中类别条件分布建模不足问题,通过引入自适应对比不对称修正技术,提升预测准确性和决策边界可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12735 2026-04-22 cs.CV cs.CL 81%

VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph

VimRAG:通过多模态记忆图导航大规模视觉上下文

Qiuchen Wang, Shihang Wang, Yu Zeng, Qiang Zhang, Fanrui Zhang, Zhuoning Guo, Bosi Zhang, Wenxuan Huang, Lin Chen, Zehui Chen, Pengjun Xie, Ruixue Ding

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 VimRAG通过多模态记忆图提升检索增强生成在处理大规模视觉上下文中的能力,采用动态有向无环图结构和图调制视觉记忆编码机制,实现高效的信息检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16313 2026-04-21 cs.IR cs.AI cs.CL 81%

MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering

MARA:一种多模态自适应检索增强框架用于文档问答

Hui Wu, Haoquan Zhai, Yuchen Li, Hengyi Cai, Peirong Zhang, Yidan Zhang, Lei Wang, Chunle Wang, Yingyan Hou, Shuaiqiang Wang, Dawei Yin

机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), AIRI, CAS(目标认知与应用技术重点实验室(TCAT),空气动力研究所,中国科学院) School of Electronic, Electrical and Communication Engineering, UCAS(电子、电气与通信工程学院,中国科学院大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院) Baidu Inc.(百度公司)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MARA框架通过引入查询自适应机制提升多模态文档检索与生成的精度和质量,实验表明其在多模态问答基准上优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07415 2026-04-21 cs.CV cs.CL cs.LG 81%

RA-RRG: Multimodal Retrieval-Augmented Radiology Report Generation with Key Phrase Extraction

RA-RRG:结合关键短语提取的多模态检索增强放射学报告生成

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司) Department of Artificial Intelligence and Data Science, Sejong University(Sejong大学人工智能与数据科学系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 RA-RRG通过结合多模态检索与大语言模型生成放射学报告,减少幻觉和计算需求,实验显示在CheXbert指标上优于现有模型。

Comments ACL 2026, Findings of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15210 2026-04-17 cs.AI cs.CL 81%

Learning to Think Like a Cartoon Captionist: Incongruity-Resolution Supervision for Multimodal Humor Understanding

学习像卡通标题作家一样思考:用于多模态幽默理解的不一致-解决监督

Hatice Merve Vural, Doga Kukul, Ege Erdem Ozlu, Demir Ekin Arikan, Bob Mankoff, Erkut Erdem, Aykut Erdem

机构 * Koç University(科克大学) KUIS AI Center(KUIS人工智能中心) Air Mail and Cartoon Collections(Air Mail和卡通收藏) Hacettepe University(哈恰特佩大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出IRS框架,通过分解幽默理解为不一致建模、解决建模和偏好对齐,提升多模态幽默理解能力,在NYCC基准上优于现有模型,且在零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12352 2026-04-15 cs.AI cs.CL 81%

MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents

多文档融合:一种用于长工业文档增强RAG的分块流程

Joongmin Shin, Chanjun Park, Jeongbae Park, Jaehyung Seo, Heuiseok Lim

机构 * Human-inspired AI Research(人机协同人工智能研究所) Department of Computer Science and Engineering(计算机科学与工程系) School of Software(软件学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对长工业文档结构复杂的问题,提出MultiDocFusion分块流程,结合视觉解析、OCR提取、层次结构重建和DFS分组,提升RAG检索精度和问答质量。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18095 2026-04-08 cs.IR cs.CL cs.CV 81%

MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction

MetaEmbed:通过灵活的后期交互实现测试时多模态检索的扩展

Zilin Xiao, Qi Ma, Mengting Gu, Chun-cheng Jason Chen, Xintao Chen, Vicente Ordonez, Vijai Mohan

机构 * Meta Superintelligence Labs(Meta超级智能实验室) Rice University(莱斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MetaEmbed通过灵活的后期交互机制,在测试时实现多模态检索的扩展,通过多向量检索训练提升信息组织能力,实现在大规模模型下的高效检索性能。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14408 2026-03-24 cs.CV cs.AI 81%

Feature Recalibration Based Olfactory-Visual Multimodal Model for Enhanced Rice Deterioration Detection

基于特征重校准的嗅觉-视觉多模态模型用于增强稻米劣变检测

Rongqiang Zhao, Hengrui Hu, Yijing Wang, Mingchun Sun, Jie Liu

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) National Key Laboratory of Smart Farm Technologies and Systems(国家智能农业技术与系统重点实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于特征重校准的嗅觉-视觉多模态模型,通过改进的特征嵌入构造器和重校准注意力网络,提升稻米劣变检测的准确性和效率,相比传统方法提升11.51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16289 2026-03-19 cs.CV cs.AI 81%

VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents

VisBrowse-Bench:多模态浏览代理的视觉原生搜索基准测试

Zhengbo Zhang, Jinbo Su, Zhaowen Zhou, Changtao Miao, Yuhan Hong, Qimeng Wu, Yumeng Liu, Feier Wu, Yihe Tian, Yuhao Liang, Zitong Shan, Wanke Xia, Yi-Fan Zhang, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

机构 * CASIA Ant Digital Technologies Ant Group(蚂蚁集团数字技术部) RUC(清华大学) FZU(福建师范大学) THU(清华大学) USTB(北京科技大学) PKU(北京大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisBrowse-Bench,用于评估多模态浏览代理的视觉推理能力,通过文本-图像检索和联合推理进行多模态证据交叉验证,验证了不同模型在搜索过程中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08202 2026-03-10 cs.CV cs.AI 81%

MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data

MM-TS: 多模态温度和边距调度用于长尾数据的对比学习

Siarhei Sheludzko, Dhimitrios Duka, Bernt Schiele, Hilde Kuehne, Anna Kukleva

机构 * University of Bonn(波恩大学) MPI for Informatics, SIC(信息研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 MM-TS通过动态温度和边距调度提升多模态对比学习在长尾数据上的性能,实现InfoNCE和最大边距方法的统一。

Comments 18 pages, 11 figures. Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04772 2026-03-06 cs.CL cs.AI 81%

TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings

TSEmbed: 解锁通用多模态嵌入中的任务扩展

Yebo Wu, Feng Liu, Ziwei Xie, Zhiyuan Liu, Changwang Zhang, Jun Wang, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(物联网科学与技术国家重点实验室,澳门大学) OPPO Research Institute(OPPO研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 TSEmbed通过融合MoE与LoRA,结合专家感知负采样策略,提升通用多模态嵌入的任务扩展能力,并在基准和工业数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03637 2026-03-05 cs.CV cs.AI cs.CR 81%

Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions

基于图像的提示注入:通过视觉嵌入的对抗性指令劫持多模态大语言模型

Neha Nagaraja, Lan Zhang, Zhilong Wang, Bo Zhang, Pawan Patil

机构 * Northern Arizona University(北亚利桑那大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究提出基于图像的提示注入攻击方法,通过视觉嵌入对抗性指令,成功操控多模态大语言模型输出,揭示了该攻击的有效性和潜在威胁。

Comments 7 pages, published in 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria, 2025, pp. 916-922

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23369 2026-03-02 cs.IR cs.AI cs.CL 81%

Reason to Contrast: A Cascaded Multimodal Retrieval Framework

对比之理:一种级联多模态检索框架

Xuanming Cui, Hong-You Chen, Hao Yu, Hao Yuan, Zihao Wang, Shlok Kumar Mishra, Hanchao Yu, Yonghuan Yang, Jun Xiao, Ser-Nam Lim, Jianpeng Cheng, Qi Guo, Xiangjun Fan

机构 * AI at Meta(Meta人工智能部门) University of Central Florida(中央佛罗里达大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TTE-v2框架,通过引入基于额外输入标记预算的推理驱动性能扩展,提升多模态检索的测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01390 2026-02-16 cs.CV cs.AI cs.LG 81%

Multimodal Doctor-in-the-Loop: A Clinically-Guided Explainable Framework for Predicting Pathological Response in Non-Small Cell Lung Cancer

多模态医生在环:一种临床指导的可解释框架,用于预测非小细胞肺癌的病理反应

Alice Natalina Caragliano, Claudia Tacconi, Carlo Greco, Lorenzo Nibid, Edy Ippolito, Michele Fiore, Giuseppe Perrone, Sara Ramella, Paolo Soda, Valerio Guarrasi

机构 * Research Unit of Computer Systems and Bioinformatics, Department of Engineering(计算机系统与生物信息学研究单位,工程系) Research Unit of Radiation Oncology, Department of Medicine and Surgery(放射肿瘤学研究单位,医学与外科系) Research Unit of Anatomical Pathology, Department of Medicine and Surgery(病理学研究单位,医学与外科系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出多模态医生在环框架,结合影像与临床数据,通过嵌入医生知识提升肺癌病理反应预测的准确性和可解释性。

Comments arXiv admin note: substantial text overlap with arXiv:2502.17503

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11737 2026-02-13 cs.CV cs.CL 81%

Mask What Matters: Mitigating Object Hallucinations in Multimodal Large Language Models with Object-Aligned Visual Contrastive Decoding

关注关键要素:通过对象对齐的视觉对比解码缓解多模态大语言模型中的对象幻觉

Boqi Chen, Xudong Liu, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) Amazon(亚马逊) MBZUAI(穆罕默德·本·拉什德智能科学技术研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种通过对象对齐的视觉对比解码缓解多模态大语言模型中对象幻觉的方法,具有计算开销低且兼容性强的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08342 2026-02-10 cs.CV cs.AI 81%

UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science

UrbanGraphEmbeddings: 学习和评估空间导向的多模态嵌入用于城市科学

Jie Zhang, Xingtong Yu, Yuan Fang, Rudi Stouffs, Zdravko Trivic

机构 * National University of Singapore Department of Architecture Singapore The Chinese University of Hong Kong Dept of Systems Eng. \& Eng. Mgmt. China Singapore Management University School of Computing \& Info. Systems Singapore National University of Singapore Department of Architecture The Chinese University of Hong Kong Singapore Management University

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UGE框架,通过空间导向的多模态嵌入提升城市理解任务性能,实验显示在图像检索和地理位置排名上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04136 2026-02-04 cs.CV cs.AI 81%

UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval

UniFGVC: 一种通用无训练少样本细粒度视觉分类方法通过属性感知多模态检索

Hongyu Guo, Xiangzhao Hao, Jiarui Guo, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) Foundation Modal Research Center, Institute of Automation, Chinese Academy of Sciences(基础模态研究中心,自动化研究所) Queen Mary School Hainan, Beijing University of Posts and Telecommunications(海南女王学院,北京邮电大学) Department of Computer Science, NUS School of Computing(计算机科学系,国立大学计算机学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 UniFGVC通过属性感知多模态检索方法,实现无训练少样本细粒度视觉分类,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏