arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-24 至 2025-11-24 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2511.01588 2025-11-24 cs.LG cs.CV 83%

Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization

探索更多,学习更好:基于互信息最小化的并行 MLLM 嵌入

Zhicheng Wang, Chen Ju, Xu Chen, Shuai Xiao, Jinsong Lan, Xiaoyong Zhu, Ying Chen, Zhiguo Cao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 跨模态检索 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于互信息最小化的并行解耦框架,通过多条并行路径提升多模态嵌入质量,实现高效且鲁棒的嵌入空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09878 2025-11-24 cs.CV cs.AI cs.RO 81%

CleverDistiller: Simple and Spatially Consistent Cross-modal Distillation

CleverDistiller: 简单且空间一致的跨模态知识蒸馏

Hariprasath Govindarajan, Maciej K. Wozniak, Marvin Klingner, Camille Maurice, B Ravi Kiran, Senthil Yogamani

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 CleverDistiller通过简单有效的跨模态知识蒸馏方法,在自动驾驶任务中实现语义分割和3D目标检测的高性能表现。

Comments Accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07419 2025-11-24 cs.IR cs.MM 79%

Breaking the Curse of Knowledge: Towards Effective Multimodal Recommendation using Knowledge Soft Integration

突破知识诅咒:通过知识软整合实现有效的多模态推荐

Kai Ouyang, Chen Tang, Zenghao Chai, Wenhao Zheng, Xiangjin Xie, Xuanji Xiao, Zhi Wang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出KSI框架,通过知识软整合解决多模态推荐中的知识诅咒问题,提升推荐个性化效果。

Comments Accepted to IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17255 2025-11-24 cs.CV cs.IR 57%

A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback

略多一些像这个:利用视觉语言模型进行文本到图像检索的相关反馈

Bulat Khaertdinov, Mirela Popa, Nava Tintarev

机构 * Maastricht University(马斯特里赫特大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于相关反馈机制提升视觉语言模型文本到图像检索性能的方法,通过四种反馈策略在Flickr30k和COCO数据集上验证,提升了检索效果并增强了多轮检索的鲁棒性。

Comments Accepted to WACV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16950 2025-11-24 physics.optics 50%

Single-Axis Ptychographic Coherent Diffractive Imaging for Spectroscopic and Wavefront Retrieval

单轴投影衍射成像用于光谱和波前恢复

Qijun You, Lingshuo Meng, Fangrui Quan, Wei Cao

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 单轴投影衍射成像技术通过单轴扫描提高通量,实现光谱和波前的同步成像,用于高效多模式实时成像。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏