arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-25 至 2026-08-25 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 15 篇

2608.19218 2026-08-25 cs.CL cs.AI cs.LG 版本更新 86%

Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life Prediction

用于将多模态语言模型与剩余使用寿命关联的时间序列检索

Valeriu Dimidov, Raphaël Frank

机构 * University of Luxembourg(卢森堡大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出时间序列检索关联的多模态大语言模型框架,在C-MAPSS基准FD001分区实验显示,该方法可提升RUL预测的误差与稳定性,且效果随模型容量变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23102 2026-08-25 cs.CV cs.IR 新提交 85%

Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models

无需训练的伪融合:基于扩散模型和多模态大语言模型的组合图像检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出无需训练的PeFuse伪融合框架,结合扩散模型与多模态大语言模型,将组合图像检索转化为单模态检索任务,在零样本场景下实现了媲美当前最优方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21808 2026-08-25 cs.CL 新提交 85%

MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning

MCite-RL:基于引用增强型智能体强化学习的可靠多模态检索增强生成

Suifeng Zhao, Zida Liu, Xinyu Lei, Lei Sun, Jun Gao, Sujian Li

机构 * Peking University(北京大学) Panasonic Connect Co., Ltd.(松下连接株式会社)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.CL

AI总结 针对现有多模态RAG存在的视觉引用不准或与答案脱节问题,本文提出MCite-RL框架,通过智能体优化模块和引用增强型奖励机制实现引用精度与答案质量的联合优化,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22786 2026-08-25 cs.LG 新提交 85%

ReCoG: Reciprocal Co-Evolution for Multimodal Graph Learning

ReCoG:面向多模态图学习的互惠协同演化

Rui Xue, Tianfu Wu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 ReCoG是将图结构学习与多模态表示学习紧密耦合的新范式,在节点分类和链接预测基准中优于多模态图结构学习基线,证明了结构与语义协同演化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22500 2026-08-25 cs.CV 新提交 84%

Learning Sample-wise Rank-aware Interpolation Weights for Composed Visual Data Retrieval

面向组合视觉数据检索的逐样本感知插值权重学习

Boseung Jeong, Taegyu Park, Donghyeon Kwon, Hyunsouk Cho, Suha Kwak

机构 * AI Center, Samsung Electronics(三星电子AI中心) POSTECH(浦项科技大学) Ajou University(明知大学)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 针对组合视觉数据检索中基于MLLM方法延迟高的问题,提出SRAIN框架,通过批量排名感知权重估计和合成难负样本的内存库,实现低延迟且性能优异的检索。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21450 2026-08-25 cs.CV 新提交 81%

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

超越视觉相似度:面向基于知识的视觉问答的实体对齐检索

Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong, Xiangwen Deng, Zhifang Liu, Peng Jiao, Haoqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Arizona(亚利桑那大学)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 针对KB-VQA现有检索范式忽略实体语义对齐的缺陷,提出首个MLLM嵌入检索器KBMR,结合语义判别器与连续语义蒸馏目标,在Recall@1和VQA准确率上较CLIP基线实现显著提升。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22115 2026-08-25 cs.LG 新提交 78%

CST: Collaborative Selective Transmission for Communication-Efficient Multimodal Edge Inference

CST:面向通信高效多模态边缘推理的协作式选择性传输

Hai Chi, Junrui Zhang, Rui Ning, Chonggang Wang, Robert Gazda, Huanrui Yang, Hongyi Wu

机构 * University of Arizona(亚利桑那大学) Old Dominion University(奥多明尼昂大学) InterDigital(InterDigital公司)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对多模态边缘推理的通信开销与延迟问题,提出CST框架,仅传输辅助设备与主设备表征互补的稀疏特征,在低特征传输占比下实现最优任务性能,且端到端推理速度最高提升4.27倍。

Comments 11 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23291 2026-08-25 cs.IR 版本更新 78%

URecJPQ: Memory-efficient Multimodal Recommendation Models through RecJPQ in Large-Scale Scenarios

URecJPQ:大规模场景下通过RecJPQ实现内存高效的多模态推荐模型

Giuseppe Spillo, Zixuan Yi, Aleksandr Petrov, Cataldo Musto, Craig Macdonald, Iadh Ounis

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出URecJPQ方法,通过联合乘积量化将用户/物品表示为共享子嵌入的拼接,显著减少参数量和内存占用,在大规模多模态推荐中实现86%-98%的模型压缩,仅轻微损失精度。

Comments This manuscript has been published in the Springer's Journal of Intelligent Information Systems: this https URL (https://link.springer.com/article/10.1007/s10844-026-01088-x)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22642 2026-08-25 cs.LG cs.AI 新提交 74%

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

Mol-JEPA:用于分子的多模态联合嵌入预测架构

Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

机构 * University of Tübingen(蒂宾根大学) Boehringer Ingelheim(勃林格殷格翰) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21714 2026-08-25 cs.CL 新提交 74%

LëtzCross: A Cross-Lingual Page-Level Benchmark for Multimodal Retrieval over Luxembourgish Documents

LëtzCross:面向卢森堡语文档的多模态检索跨语言页面级基准

Omar El Bachyr, Fred Philippy, Laura Maria Bernardy, Saad Ezzini, Jacques Klein, Tegawende Bissyande

机构 * University of Luxembourg(卢森堡大学) King Fahd University of Petroleum and Minerals(法赫德国王石油矿产大学)

专题命中 跨模态检索 :multimodal(title);分类 cs.CL

AI总结 该研究推出LëtzCross基准,对比纯文本与ColPali式页面图像检索器,发现后者表现更优,还明确单语言微调中法语文对卢森堡语查询表现最高、多语言微调中纳入卢森堡语效果最强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21431 2026-08-25 cs.CV cs.MM 新提交 62%

Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning

基于结构化上下文推理提升基于知识的视觉问答性能

Qiyou Liu, Yong Zhang, Jianjie Luo, Zhenguo Yang, Yi Yu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出SCoRe框架,通过上下文获取、选择、压缩三阶段处理多模态知识,在OK-VQA和A-OKVQA基准上性能优于现有最优方法,提升了基于知识的视觉问答效果。

Comments Accepted by ICME 2026. Source code is available at this https URL (https://github.com/WISLab-GDUT/SCoRe)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22785 2026-08-25 cs.CV 新提交 57%

OmicSync: Reliability-Aware Spatial Multi-Omics Clustering with Evidence-Constrained LLM Reasoning

OmicSync:结合证据约束大语言模型推理的可靠性感知空间多组学聚类

Rabeya Tus Sadia, Qiang Ye, Qiang Cheng

机构 * University of Kentucky(肯塔基大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 OmicSync是结合证据约束LLM推理的可靠性感知空间多组学聚类框架,集成KAN-GCN骨干等功能,在多组学基准测试中表现优异,OmicSync-R进一步提升了人乳腺癌的聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21913 2026-08-25 cs.CV 新提交 57%

Entity-Constrained CBCT Retrieval for Low-Resource Dental Record Completion

用于低资源牙科记录补全的实体约束锥形束计算机断层扫描(CBCT)检索

Nhi Ngoc-Yen Nguyen, Thai Nguyen, Kiet Huynh Cao Tuan, Huy-Hieu Pham

机构 * VinUniversity Vietnam National University Ho Chi Minh City(胡志明市国家大学) University of Science(科学大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对低资源牙科记录补全难题,提出实体约束CBCT引导检索框架,其在MMDental任务3验证集与测试集上均优于基线方法,获测试阶段第二名,证实控制多模态证据修改范围比传输完整记录更可靠。

Comments Accepted at the ODIN 2026 Workshop, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17906 2026-08-25 cs.AI cs.MA 版本更新 57%

AutoResearch: Insight In, Hallucination Out

AutoResearch:输入洞见,输出无幻觉

Yiming Ren, Xiang Liu, Qumeng Sun, Xiao Zhang, Jiahao Li, Haoyang Zhang, Junjie Wang

机构 * EvoMap(伊沃地图)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 AutoResearch是两阶段自主研究系统,通过创意生成与执行结合,在多场景提升研究进展,修正实验结果,在RSICD基准上召回率提升且问题事件更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21411 2026-08-25 cs.RO 新提交 50%

Social Graph Mamba: Forecasting Pedestrian Movements Based on Social Context

社交图Mamba:基于社交上下文的行人运动预测

Hong-Son Nguyen, Yen-Chen Liu

机构 * National Cheng Kung University(成功大学)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本研究提出Social Graph Mamba(SGM),用选择性状态空间模型(SSMs)结合动态交互图与社区感知模块,以线性复杂度实现行人运动预测,在基准测试和物理机器人实验中验证了其有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏