arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-25 至 2025-12-25 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2512.20916 2025-12-25 cs.IR cs.MM 85%

MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model

MMSRARec: 基于多模态大语言模型的摘要与检索增强的序列推荐

Haoyu Wang, Yitong Wang, Jining Wang

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.MM

AI总结 本文提出MMSRARec,基于多模态大语言模型,通过摘要与检索增强序列推荐,提升推荐性能、可解释性与计算效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21221 2025-12-25 cs.CV cs.AI 73%

Leveraging Lightweight Entity Extraction for Scalable Event-Based Image Retrieval

利用轻量级实体提取实现可扩展的基于事件的图像检索

Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Phu-Hoa Pham, Tran Chi Nguyen

机构 * University of Science - VNUHCM(越南胡志明市科学大学)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种轻量级两阶段检索流程,利用事件中心实体提取结合BM25和BEiT-3模型,实现高效准确的图像检索。

Comments System description paper for EVENTA Grand Challenge Track 2 at ACM Multimedia 2025 (MM '25). Ranked 4th place. 6 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20858 2025-12-25 cs.CV 57%

ALIVE: An Avatar-Lecture Interactive Video Engine with Content-Aware Retrieval for Real-Time Interaction

ALIVE: 一种具有内容感知检索的虚拟形象-讲座交互视频引擎,用于实时交互

Md Zabirul Islam, Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系罗切斯特理工学院) Department of Biomedical Engineering Rensselaer Polytechnic Institute(生物医学工程系罗切斯特理工学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 ALIVE通过本地部署和内容感知检索,实现基于虚拟形象的实时互动学习,提升讲座的教育价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14856 2025-12-25 cs.CL 57%

T5Gemma 2: Seeing, Reading, and Understanding Longer

T5Gemma 2: 视觉、阅读与理解更长内容

Biao Zhang, Paul Suganthan, Gaël Liu, Ilya Philippov, Sahil Dua, Ben Hora, Kat Black, Gus Martins, Omar Sanseviero, Shreya Pathak, Cassidy Hardin, Francesco Visin, Jiageng Zhang, Kathleen Kenealy, Qin Yin, Xiaodan Song, Olivier Lacombe, Armand Joulin, Tris Warkentin, Adam Roberts

机构 * Google(谷歌)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 T5Gemma 2通过改进的编码器-解码器架构,实现了多模态和长上下文处理能力,同时在预训练和微调性能上优于Gemma 3。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20781 2025-12-25 cs.IR 50%

Soft Filtering: Guiding Zero-shot Composed Image Retrieval with Prescriptive and Proscriptive Constraints

软过滤:通过规劝性与禁止性约束指导零样本复合图像检索

Youjin Jung, Seongwoo Cho, Hyun-seok Min, Sungchul Choi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出SoFT方法,通过规劝性和禁止性约束提升零样本复合图像检索的准确性与鲁棒性。

Comments Accepted to AAAI 2026 Workshop on New Frontiers in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏