arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-08 至 2026-01-08 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 6 篇

2601.04127 2026-01-08 cs.CV cs.AI 81%

Pixel-Wise Multimodal Contrastive Learning for Remote Sensing Images

像素级多模态对比学习用于遥感图像

Leandro Stival, Ricardo da Silva Torres, Helio Pedrini

机构 * Wageningen University & Research(瓦赫宁根大学与研究学院) Institute of Computing, University of Campinas (UNICAMP)(计算学院,坎皮纳斯大学(UNICAMP))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出像素级多模态对比学习方法,通过二维表示和对比学习提升遥感图像中特征提取效果,优于现有方法。

Comments 21 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01513 2026-01-08 cs.CV cs.AI 62%

FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation

FastV-RAG: 向快速且细粒度的视频问答迈进:基于检索增强生成的框架

Gen Li, Peiyu Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of International Business and Economics(国际商务经济大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FastV-RAG通过引入推测解码和基于相似性的过滤策略,提升视频问答任务的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03270 2026-01-08 cs.CL cs.AI math.OC 62%

Advances and Challenges in Semantic Textual Similarity: A Comprehensive Survey

语义文本相似性的发展与挑战:全面综述

Lokendra Kumar, Neelesh S. Upadhye, Kannan Piedy

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了语义文本相似性在变压器模型、对比学习、领域适应等六个方面的最新进展,探讨了多模态、图方法和知识增强技术,并指出现有挑战与未来发展方向。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07344 2026-01-08 cs.DC cs.AI 57%

Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding

Venus: 一种高效的边缘内存与检索系统用于基于VLM的在线视频理解

Shengyuan Ye, Bei Ouyang, Tianyi Qian, Liekang Zeng, Mu Yuan, Xiaowen Chu, Weijie Hong, Xu Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(计算机科学与工程学院,中山大学,广州,中国) Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(信息工程系,香港中文大学,香港特别行政区,中国) Shenzhen Smart City Communications Co., Ltd., China(深圳智慧城市通信有限公司,中国)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 Venus提出了一种高效的边缘内存与检索系统,通过边缘-云解耦架构实现快速的在线视频理解,显著降低系统开销并提升响应速度。

Comments Accepted by IEEE International Conference on Computer Communications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07227 2026-01-08 cs.CV cs.IR 57%

Which Country Is This? Automatic Country Ranking of Street View Photos

这是哪个国家?街景照片的自动国家排名

Tim Menzner, Jochen L. Leidner, Florian Mittag

机构 * Coburg University of Applied Sciences and Arts(科堡应用科学与艺术大学) University of Sheffield(谢菲尔德大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Country Guesser系统,通过结合计算机视觉、机器学习和文本检索方法,对街景照片中的地点进行国家排名预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03262 2026-01-08 cs.IR cs.CL 57%

Roles of MLLMs in Visually Rich Document Retrieval for RAG: A Survey

多模态大语言模型在视觉丰富文档检索中的作用:一项综述

Xiantao Zhang

机构 * Beihang University(北航大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文综述了多模态大语言模型在视觉丰富文档检索中的应用,探讨了三种关键角色及其在RAG中的作用与权衡。

Comments 18 pages; accepted at AACL-IJCNLP 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏