arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-03 至 2026-03-03 共收录 25 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 25 篇

2603.01082 2026-03-03 cs.CV cs.IR 85%

Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval

超越全局相似性:面向细粒度、多条件多模态检索

Xuan Lu, Kangle Li, Haohang Huang, Rui Meng, Wenjun Zeng, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23589 2026-03-03 cs.CV cs.AI 84%

Pseudo Contrastive Learning for Diagram Comprehension in Multimodal Models

伪对比学习用于多模态模型中的图表理解

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究机构有限公司)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出伪对比学习方法,通过生成合成图表增强多模态模型对图表的理解能力,实验表明在图像-文本匹配和视觉问答任务中优于传统CLIP方法。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00510 2026-03-03 cs.CV cs.AI 84%

What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models

视觉标记究竟编码了什么?揭示多模态大语言模型中的稀疏性与冗余性

Yingqi Fan, Junlong Tong, Anhao Zhao, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本研究揭示多模态大语言模型中视觉标记的稀疏性与冗余性,通过EmbedLens工具发现活跃标记在进入模型前已编码细粒度信息,并提出中层注入方法提升效率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00172 2026-03-03 cs.CR cs.AI 83%

Hidden in the Metadata: Stealth Poisoning Attacks on Multimodal Retrieval-Augmented Generation

元数据中的隐藏攻击:多模态检索增强生成中的隐秘污染攻击

Kennedy Edemacu, Mohammad Mahdi Shokri

机构 * The City University of New York, CSI, Staten Island, NY 10314, USA(纽约城市大学,CSI,史泰登岛分校) The City University of New York, Graduate Center, New York, NY 10016, USA(纽约城市大学研究生中心)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 本研究提出MM-MEPA,一种通过操纵多模态检索条目元数据来影响模型响应的隐秘污染攻击,展示了其在多模态RAG系统中的高攻击成功率和防御不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13061 2026-03-03 cs.CL cs.AI cs.CV cs.LG 82%

Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection

鲁棒适应大规模多模态模型用于检索增强的仇恨表情包检测

Jingbiao Mei, Jinghong Chen, Guangyu Yang, Weizhe Lin, Bill Byrne

机构 * Department of Engineering University of Cambridge(工程系剑桥大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种鲁棒适应框架,用于提升大规模多模态模型在检索增强的仇恨表情包检测中的性能与泛化能力,同时提高模型的可解释性。

Comments EMNLP 2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00500 2026-03-03 cs.RO 82%

Zero-Shot Robotic Manipulation via 3D Gaussian Splatting-Enhanced Multimodal Retrieval-Augmented Generation

通过3D高斯点云增强的多模态检索增强生成实现零样本机器人操作

Zilong Xie, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yuan Xie

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出RobMRAG框架,通过3D高斯点云增强多模态检索增强生成,提升零样本机器人操作的泛化能力和可解释性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02047 2026-03-03 cs.CV 79%

NICO-RAG: Multimodal Hypergraph Retrieval-Augmented Generation for Understanding the Nicotine Public Health Crisis

NICO-RAG:多模态超图检索增强生成用于理解尼古丁公共卫生危机

Manuel Serna-Aguilera, Raegan Anderes, Page Dobbs, Khoa Luu

机构 * University of Arkansas(亚拉巴马大学) University of Arkansas for Medical Sciences(亚拉巴马大学医学科学分校)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 NICO-RAG通过多模态超图检索增强生成,解决尼古丁公共卫生危机中的信息检索与生成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00511 2026-03-03 cs.CV cs.LG 79%

Multimodal Adaptive Retrieval Augmented Generation through Internal Representation Learning

多模态自适应检索增强生成通过内部表示学习

Ruoshuang Du, Xin Sun, Qiang Liu, Bowen Song, Zhongqi Chen, Weiqiang Wang, Liang Wang

机构 * Shanghaitech University School of Information Science(上海科技大学信息科学学院) Chinese Academy of Sciences Institute of Automation(中国科学院自动化研究所)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MMA-RAG,通过动态评估模型内部知识置信度,提升视觉问答系统在多模态场景下的检索增强生成性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13104 2026-03-03 cs.LG cs.CL 79%

Equitable Electronic Health Record Prediction with FAME: Fairness-Aware Multimodal Embedding

基于FAME的公平电子健康记录预测:具有公平性的多模态嵌入

Nikkie Hooman, Zhongjie Wu, Eric C. Larson, Mehak Gupta

机构 * Department of Computer Science(计算机科学系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 FAME通过公平性意识的多模态嵌入框架,在电子健康记录预测中实现性能与公平性的双重优化。

Comments 21 pages, 3 figures

Journal ref Proceedings of Machine Learning Research 2025 (Machine Learning for Healthcare, ML4H)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10030 2026-03-03 cs.CR cs.AI 79%

Safeguarding Multimodal Knowledge Copyright in the RAG-as-a-Service Environment

在RAG-as-a-Service环境中保护多模态知识版权

Tianyu Chen, Jian Lou, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 AQUA是一种用于多模态RAG系统中图像知识保护的首个水印框架,通过嵌入语义信号实现高效、隐蔽的版权追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01590 2026-03-03 cs.IR cs.LG 78%

IDProxy: Cold-Start CTR Prediction for Ads and Recommendation at Xiaohongshu with Multimodal LLMs

IDProxy:小红书广告与推荐中基于多模态大语言模型的冷启动CTR预测

Yubin Zhang, Haiming Xu, Guillaume Salha-Galvan, Ruiyan Han, Feiyang Xiao, Yanhua Huang, Li Lin, Yang Luo, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 IDProxy通过多模态大语言模型生成代理嵌入,解决广告和推荐系统中物品冷启动的CTR预测问题,实现与现有嵌入空间的对齐和端到端优化,已在小红书大规模应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04812 2026-03-03 cs.CV cs.AI cs.CL cs.LG 75%

LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning

LLaVE: 大规模语言和视觉嵌入模型与基于难度加权的对比学习

Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 LLaVE通过基于难度加权的对比学习提升多模态嵌入模型性能,实现SOTA表现和强泛化能力。

Comments Accepted by Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20095 2026-03-03 cs.CV cs.CL cs.LG 73%

BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models

BioCAP: 利用合成描述性注释超越标签在生物基础模型中的应用

Ziheng Zhang, Xinyue Ma, Arpita Chowdhury, Elizabeth G. Campolongo, Matthew J. Thompson, Net Zhang, Samuel Stevens, Hilmar Lapp, Tanya Berger-Wolf, Yu Su, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Duke University(杜克大学) Boston University(波士顿大学)

专题命中 跨模态检索 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

AI总结 BioCAP通过生成合成描述性注释提升生物基础模型的性能,实现物种分类和文本-图像检索的高准确率。

Comments ICLR 2026; Project page: https://imageomics.github.io/biocap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01632 2026-03-03 cs.LG cs.AI 70%

DeLo: Dual Decomposed Low-Rank Experts Collaboration for Continual Missing Modality Learning

DeLo:双分解低秩专家协作用于持续缺失模态学习

Xiwei Liu, Yulong Li, Feilong Tang, Imran Razzak

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 DeLo通过双分解低秩专家架构解决持续缺失模态学习中的模态干扰问题,结合跨模态引导路由和任务键记忆实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04932 2026-03-03 cs.CV 70%

UniView: Enhancing Novel View Synthesis From A Single Image By Unifying Reference Features

UniView: 通过统一参考特征从单张图像增强新颖视角合成

Haowang Cui, Rui Chen, Jiaze Wang, Tao Guo, Zheng Qin

机构 * Tianjin University(天津大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 UniView通过统一参考特征提升单张图像新颖视角合成性能,采用检索增强系统和多模态大语言模型选择参考图像,并结合解耦三重注意力机制提高合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01990 2026-03-03 cs.AI cs.CL cs.CV 67%

According to Me: Long-Term Personalized Referential Memory QA

根据我:长期个性化参照记忆问答

Jingbiao Mei, Jinghong Chen, Guangyu Yang, Xinyu Hou, Margaret Li, Bill Byrne

机构 * Department of Engineering, University of Cambridge, United Kingdom(剑桥大学工程系) Department of Physics, University of Cambridge, United Kingdom(剑桥大学物理系) Independent Researcher(独立研究者)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出ATM-Bench,首个多模态多来源个性化参照记忆问答基准,并提出Schema-Guided Memory方法提升记忆推理性能

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01493 2026-03-03 cs.IR cs.AI cs.CV cs.MM 67%

PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval

PhotoBench: 超越视觉匹配,迈向个性化意图驱动的图片检索

Tianyi Xu, Rong Shan, Junjie Wu, Jiadeng Huang, Teng Wang, Jiachen Zhu, Wenteng Chen, Minxin Tu, Quantao Dou, Zhaoxiang Wang, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 PhotoBench 是首个基于真实个人相册构建的基准,旨在通过多源意图驱动推理提升个性化图片检索能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19385 2026-03-03 cs.CV cs.CL cs.LG 62%

Adaptive Data Augmentation with Multi-armed Bandit: Sample-Efficient Embedding Calibration for Implicit Pattern Recognition

自适应数据增强与多臂老虎机:用于隐式模式识别的样本高效嵌入校准

Minxue Tang, Yangyang Yu, Aolin Ding, Maziyar Baran Pouyan, Taha Belkhouja, Yujia Bao

机构 * Duke University(杜克大学) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出ADAMAB框架,通过多臂老虎机机制实现样本高效的隐式模式识别,实验表明其在少样本情况下准确率提升达40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01666 2026-03-03 cs.CL cs.IR 57%

Beyond the Grid: Layout-Informed Multi-Vector Retrieval with Parsed Visual Document Representations

超越网格:基于解析视觉文档表示的布局感知多向量检索

Yibo Yan, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Jiahao Huo, Yu Huang, James Kwok, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Alibaba Cloud Computing(阿里云计算)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 ColParse通过生成布局感知的子图像嵌入和全局向量融合,实现高效多向量检索,显著降低存储需求并提升性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01048 2026-03-03 cs.SE cs.AI 57%

RepoRepair: Leveraging Code Documentation for Repository-Level Automated Program Repair

RepoRepair: 利用代码文档实现仓库级别的自动程序修复

Zhongqiang Pan, Chuanyi Li, Wenkang Zhong, Yi Feng, Bin Luo, Vincent Ng

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Human Language Technology Research Institute, University of Texas at Dallas(人机语言技术研究院,德克萨斯大学达拉斯分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 RepoRepair通过生成代码文档增强LLM能力,实现仓库级别的自动程序修复,取得高修复率和低成本的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00599 2026-03-03 cs.AI cs.LG 57%

Heterophily-Agnostic Hypergraph Neural Networks with Riemannian Local Exchanger

无异质性偏见的超图神经网络与黎曼局部交换器

Li Sun, Ming Zhang, Wenxin Jin, Zhongtian Sun, Zhenhao Huang, Hao Peng, Sen Su, Philip Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) North China Electric Power University(华北电力大学) University of Kent(肯特大学) Beihang University(北航) University of Illinois(伊利诺伊大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出HealHGNN,通过黎曼几何和自适应局部交换器实现异质性无关的超图神经网络,提升长距离依赖建模和表示区分性。

Comments Accepted by WWW'26, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00503 2026-03-03 cs.CV 57%

M$^2$: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval

M$^2$: 通过轨迹摘要和洞察检索实现长 horizon 网络代理的双记忆增强

Dawei Yan, Haokui Zhang, Guangda Huzhang, Yang Li, Yibo Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Ying Li, Wei Dong, Chunhua Shen

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学) AI Business, Alibaba Group, Hangzhou, China(阿里云人工智能业务) Xi'an University of Architecture(西安建筑科技大学) Zhejiang University, Hangzhou, China(浙江大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 M$^2$通过双记忆机制提升长 horizon 网络代理的上下文效率和决策鲁棒性,实现更高成功率和更低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06566 2026-03-03 cs.CV 57%

Dynamic Uncertainty Learning with Noisy Correspondence for Text-Based Person Search

基于噪声对应关系的动态不确定性学习用于基于文本的人脸搜索

Zequn Xie, Haoming Ji, Chengxuan Li, Lingwei Meng

机构 * Zhejiang University(浙江大学) Beijing University of Posts Telecommunications(北京邮电大学) Beijing Forestry University(北京林业大学) Northwest Normal University(西北师范大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DURA框架,通过动态不确定性学习和关系对齐方法,提升基于文本的人脸搜索在噪声环境下的鲁棒性和检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19096 2026-03-03 cs.LG 50%

The Power of Decaying Steps: Enhancing Attack Stability and Transferability for Sign-based Optimizers

衰减步骤的力量:提升基于符号的优化器的攻击稳定性和可迁移性

Wei Tao, Yang Dai, Jincai Huang, Qing Tao

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出MDCS方法,通过衰减步长提升基于符号优化器的攻击稳定性和可迁移性,理论证明其收敛率最优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00632 2026-03-03 cs.IR cs.LG 50%

Stop Treating Collisions Equally: Qualification-Aware Semantic ID Learning for Recommendation at Industrial Scale

停止对碰撞一视同仁:面向大规模工业场景的语义ID学习方法

Zheng Hu, Yuxin Chen, Yongsen Pan, Xu Yuan, Yuting Yin, Daoyuan Wang, Boyang Xia, Zefei Luo, Hongyang Wang, Songhao Ni, Dongxu Liang, Jun Wang, Shimin Cai, Tao Zhou, Fuji Ren, Wenwu Ou

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 QuaSID通过冲突感知机制和双塔对比目标,提升大规模推荐中语义ID的碰撞处理与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏