arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-27 至 2026-08-27 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 12 篇

2608.18504 2026-08-27 cs.AI 版本更新 85%

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

UMER:通过感知对的判别推理统一嵌入与排序以实现通用多模态检索

Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对通用多模态检索的需求,提出UMER框架,通过感知对的判别推理联合学习对比式嵌入与判别式排序,在MMEB-V2基准上实现最优性能且支持可调整预算的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08897 2026-08-27 cs.CV cs.AI cs.CL cs.MM 版本更新 85%

Recurrence Meets Transformers for Universal Multimodal Retrieval

循环机制与Transformer结合的通用多模态检索模型

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25412 2026-08-27 cs.CV 新提交 83%

AdaptiveEmbed: Sample-Adaptive Multi-Vector Representation for Multimodal Retrieval

AdaptiveEmbed:面向多模态检索的样本自适应多向量表示

Xinze Liu, Lei Yang, Dayan Wu, Hengjie Zhu, Zihao Zhang, Hanqi Wu, Tianzhu Hu, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出样本自适应多向量表示(SAMVR)新设定,构建AdaptiveEmbed框架,通过多组对比学习等技术实现样本级自适应容量分配,在多模态检索基准上验证其性能优于固定容量方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06156 2026-08-27 cs.CV cs.AI cs.CL 版本更新 82%

MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control

MMEmb-R1: 基于推理增强的多模态嵌入与配对感知选择及自适应控制

Yuchi Wang, Dingkang Yang, Haiyang Yu, Weikang Bian, Jiefeng Long, Xiao Liang, Chao Feng, Hongsheng Li

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MMEmb-R1框架,通过引入配对感知推理选择和强化学习,解决多模态嵌入中推理与对比监督不匹配及推理冗余的问题,实验显示其在MMEB-V2基准上达到71.2分,参数更少且推理效率更高。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26091 2026-08-27 cs.IR cs.CL cs.CV 新提交 81%

PlanSightRAG: A Visual-First Multimodal RAG for Automating Question Answering and Compliance Checking for Civil Standard Plans

PlanSightRAG:面向民用标准图纸的自动化问答与合规检查的视觉优先多模态检索增强生成模型

Nabaraj Subedi, Shuvo Dip Datta, Ahmed Abdelaty, Shivanand Venkanna Sheshappanavar

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对民用标准图纸的OCR自动化方法会丢失关键几何信息,本文提出视觉优先多模态RAG框架PlanSightRAG,整合多向量检索与智能体架构,构建基准数据集并验证其在检索、合规检查任务上的性能,还实现了自主视觉规则 grounding。

Comments 32 pages, 9 figures, 25 tables. Preprint submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25986 2026-08-27 cs.AI 新提交 79%

Multi-Granularity Context-Enhanced RAG over Multimodal Knowledge Graphs

面向多模态知识图谱的多粒度上下文增强检索增强生成

Zongyu Wu, Yilong Wang, Xiaochen Wang, Minhua Lin, Zhichao Xu, Fenglong Ma, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Utah(犹他大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有多模态知识图谱RAG方法的语义鸿沟问题,本文提出CEMMKG框架,通过多粒度局部与全局上下文增强,有效提升了多模态GraphRAG的性能与适用性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25780 2026-08-27 cs.IR 新提交 78%

PUMA: Post-Hoc Sparsification of Universal Multimodal Embeddings for Efficient Retrieval

PUMA:用于高效检索的通用多模态嵌入的事后稀疏化

Matteo Attimonelli, Alessandro De Bellis, Franco Maria Nardini, Claudio Pomo, Cosimo Rulli, Rossano Venturini, Tommaso Di Noia

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对通用多模态嵌入的高存储与推理成本问题,提出无需微调主干网络的PUMA稀疏自编码器方案,在五个基准上验证其可实现8-16倍存储压缩与最高25倍检索加速,且多数数据集性能与密集检索相当或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25381 2026-08-27 cs.IR 新提交 78%

MOTIF: Motivation-guided Topology Inference for Cold-start Multimodal Recommendation

MOTIF:面向冷启动多模态推荐的动机引导拓扑推断

Yurui Shi, Yuchen Miao, Ximing Hu, Zijun Wang, Chang Han

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对冷启动多模态推荐的三大耦合挑战,提出MOTIF框架,整合四类技术实现拓扑推断,在三个多模态基准上较各类基线取得最高6.07%的相对提升。

Comments 15 pages, 3 figures, 7 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25023 2026-08-27 cs.AI cs.CV 新提交 62%

CVE-SAI: Counterfactual Visual Evidence-Guided Selective Attribute Indexing for Risk-Controlled E-commerce Search

CVE-SAI:用于风险可控电商搜索的反事实视觉证据引导的选择性属性索引

Xiaolong Sun, Qichao Wang, Hangyu Li, Liang Chen

机构 * Sun Yat-Sen University(中山大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出CVE-SAI方法,将电商属性推断与索引准入分离,通过反事实视觉证据控制风险,在5%不安全准入预算下,于Amazon Berkeley Objects数据集上实现了更优的属性补全与检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26088 2026-08-27 cs.AI cs.LG 新提交 57%

Planetary Prediction Engine: Autonomous Geospatial Prediction via Intelligent Data Selection and Foundation Model Embeddings

行星预测引擎:通过智能数据选择和基础模型嵌入实现自主地理空间预测

Evelyn Ma, Rama Kumar Pasumarthi, Kishwar Shafin, Mandar Sharma, Mimi Sun, Hamed Sadeghi, Dav M. Ebengo, Mbulayi Onesime, Rouslan Solomakhin, John Wamburu, William Ogallo, Aisha Walcott-Bryant, Sanxing Chen, Arbaaz Muslim, Yael Mayer, Ronald Ho, Roy Lee, Ruth Alcantara, Abdoulaye Diack, Monica Bharel, Lambert Rosique, Jeremy Amez-Droz, Christopher Haire, James Manyika, Yossi Matias, Niv Efron, Gautam Prasad, Shravya Shetty

机构 * Google Research(谷歌研究院) Institut National de Recherche Biomédicale(国家生物医学研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出行星预测引擎(PPE),一种自主AI系统,可根据自然语言查询完成地理空间预测的端到端工作流程,在多类任务中优于现有模型,降低了行星规模分析的技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05393 2026-08-27 cs.CV 版本更新 57%

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化

Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。

Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25625 2026-08-27 cs.IR 新提交 50%

RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval

RetrievalRouter:面向文档检索的联合模态与架构选择

Emre Kuru, Mehmet Onur Keskin, Reza Farahbakhsh, Noel Crespi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 RetrievalRouter是一种轻量级查询感知路由模型,仅从查询文本为每个文档检索任务匹配合适流程,在金融、科学语料库基准测试中,其准确率较最佳静态基准高2.5%、速度快12.4倍,且优于现有自适应策略选择方法。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏