arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-09 至 2025-12-09 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 6 篇

2510.13515 2025-12-09 cs.CV cs.AI 88%

UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning

UniME-V2:基于大规模语言模型的通用多模态嵌入学习判别器

Tiancheng Gu, Kaicheng Yang, Kaichen Zhang, Xiang An, Ziyong Feng, Yueyi Zhang, Weidong Cai, Jiankang Deng, Lidong Bing

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 UniME-V2利用大规模语言模型提升通用多模态嵌入学习的判别能力,通过引入MLLM-as-a-Judge机制和重排序模型实现更高效的负样本挖掘和语义匹配。

Comments AAAI2026 Oral, Webpage:https://garygutc.github.io/UniME-v2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17432 2025-12-09 cs.CV 85%

Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs

突破模态壁垒:基于多模态大语言模型的通用嵌入学习

Tiancheng Gu, Kaicheng Yang, Ziyong Feng, Xingjun Wang, Yanzhao Zhang, Dingkun Long, Yingda Chen, Weidong Cai, Jiankang Deng

机构 * The University of Sydney(悉尼大学) DeepGlint Tongyi Lab, Alibaba Group(阿里云实验室) Imperial College London(伦敦帝国理工学院)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 UniME通过两阶段框架提升多模态表示学习,利用知识蒸馏和硬负样本微调增强判别能力与指令遵循性能。

Comments 13 pages, 8 figures, Accepted by ACM MM2025, Project page: https://garygutc.github.io/UniME

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07216 2025-12-09 cs.IR cs.LG 78%

MUSE: A Simple Yet Effective Multimodal Search-Based Framework for Lifelong User Interest Modeling

MUSE:一种简单而有效的基于多模态搜索的终身用户兴趣建模框架

Bin Wu, Feifan Yang, Zhangming Chan, Yu-Ran Gu, Jiawei Feng, Chao Yi, Xiang-Rong Sheng, Han Zhu, Jian Xu, Mang Ye, Bo Zheng

机构 * Wuhan University(武汉大学) Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 MUSE通过简单有效的多模态搜索框架,实现超长用户行为序列建模,提升推荐系统指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06449 2025-12-09 cs.IR 78%

Enhancing Medical Cross-Modal Hashing Retrieval using Dropout-Voting Mixture-of-Experts Fusion

通过Dropout投票混合专家融合增强医学跨模态哈希检索

Jaewon Ahn, Woosung Jang, Beakcheol Jang

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 本文提出MCMFH模型,通过Dropout投票和混合专家融合提升医疗跨模态哈希检索的准确性和效率。

Comments 5 pages, 1 figure, workshop paper (MMGenSR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06105 2025-12-09 cs.CV cs.AI 62%

Explainable Melanoma Diagnosis with Contrastive Learning and LLM-based Report Generation

基于对比学习和大语言模型的可解释性黑色素瘤诊断

Junwen Zheng, Xinran Xu, Li Rong Wang, Chang Cai, Lucinda Siyun Tan, Dingyuan Wang, Hong Liang Tey, Xiuyi Fan

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于对比学习和大语言模型的可解释性黑色素瘤诊断框架,通过将临床标准映射到视觉Transformer空间,实现图像与临床解释的透明连接,提升模型可解释性与临床信任度。

Comments AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07807 2025-12-09 cs.CV cs.GR 57%

Lang3D-XL: Language Embedded 3D Gaussians for Large-scale Scenes

Lang3D-XL: 语言嵌入的3D高斯用于大规模场景

Shai Krakovsky, Gal Fiebelman, Sagie Benaim, Hadar Averbuch-Elor

机构 * Tel Aviv University(特拉维夫大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 Lang3D-XL通过引入语言嵌入的3D高斯表示,提升大规模场景的语义理解和交互效率,优于现有方法。

Comments Accepted to SIGGRAPH Asia 2025. Project webpage: https://tau-vailab.github.io/Lang3D-XL

详情

展开后加载摘要…

URL PDF HTML 收藏