arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-30 至 2026-01-30 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 4 篇

2601.22055 2026-01-30 cs.CL 83%

$G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA

$G^2$-Reader: 双重演化图式用于多模态文档问答

Yaxin Du, Junru Song, Yifan Zhou, Cheng Wang, Jiahao Gu, Zimeng Chen, Menglan Chen, Wen Yao, Yang Yang, Ying Wen, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligent Game and Decision Laboratory(智能游戏与决策实验室)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 $G^2$-Reader通过双重图式解决多模态文档问答中的结构破坏和检索失效问题,实现66.21%的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09523 2026-01-30 cs.CV cs.AI cs.CY cs.LG 62%

MuseCL: Predicting Urban Socioeconomic Indicators via Multi-Semantic Contrastive Learning

MuseCL:通过多语义对比学习预测城市社会经济指标

Xixian Yong, Xiao Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MuseCL通过多语义对比学习融合视觉与文本信息,提升城市社会经济预测的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22294 2026-01-30 cs.CV 57%

A Three-Level Alignment Framework for Large-Scale 3D Retrieval and Controlled 4D Generation

一种用于大规模3D检索和受控4D生成的三级对齐框架

Philip Xu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 Uni4D通过三级对齐框架实现大规模3D检索与可控4D生成,提升多模态动态理解与应用

Comments arXiv admin note: Author list truncated. This submission has been withdrawn by arXiv administrators as authors were added without their knowledge or consent

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03517 2026-01-30 cs.LG 50%

Understanding Self-Supervised Learning via Gaussian Mixture Models

通过高斯混合模型理解自监督学习

Parikshit Bansal, Ali Kavis, Sujay Sanghavi

机构 * UT Austin(得克萨斯大学)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本文通过高斯混合模型分析自监督学习,证明对比学习能有效找到最优低维子空间,优于传统谱技术,并验证了多模态对比学习的理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏