arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-12 至 2025-08-12 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2508.07666 2025-08-12 cs.MM 88%

Towards Multimodal Sentiment Analysis via Contrastive Cross-modal Retrieval Augmentation and Hierachical Prompts

Xianbing Zhao, Shengzun Yang, Buzhou Tang, Ronghuan Jiang

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.MM

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14904 2025-08-12 eess.IV cs.AI cs.CL cs.CV 85%

Large-vocabulary forensic pathological analyses via prototypical cross-modal contrastive learning

Chen Shen, Chunfeng Lian, Wanqing Zhang, Fan Wang, Jianhua Zhang, Shuanliang Fan, Xin Wei, Gongji Wang, Kehan Li, Hongshu Mu, Hao Wu, Xinggong Liang, Jianhua Ma, Zhenyuan Wang

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 28 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07671 2025-08-12 cs.AI cs.CY cs.HC cs.MA stat.AP 57%

EMPATHIA: Multi-Faceted Human-AI Collaboration for Refugee Integration

Mohamed Rayan Barhdadi, Mehmet Tuncel, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯A&M大学) Istanbul Technical University(伊斯坦布尔技术大学) Hamad Bin Khalifa University(哈利法大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

Comments 19 pages, 3 figures (plus 6 figures in supplementary), 2 tables, 1 algorithm. Submitted to NeurIPS 2025 Creative AI Track: Humanity

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16919 2025-08-12 cs.CV 57%

TAR3D: Creating High-Quality 3D Assets via Next-Part Prediction

Xuying Zhang, Yutong Liu, Yangguang Li, Renrui Zhang, Yufei Liu, Kai Wang, Wanli Ouyang, Zhiwei Xiong, Peng Gao, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) NKIARI, Shenzhen Futian(深圳未来科技研究院) USTC(University of Science and Technology of China) CUHK MMLab(香港中文大学MMLab) VAST(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted at ICCV 2025. Project page: https://github.com/HVision-NKU/TAR3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06691 2025-08-12 cond-mat.mtrl-sci cs.LG 50%

Role of Large Language Models and Retrieval-Augmented Generation for Accelerating Crystalline Material Discovery: A Systematic Review

Agada Joseph Oche, Arpan Biswas

机构 * Bredesen Center for Interdisciplinary Research, University of Tennessee, Knoxville, USA(跨学科研究中心,田纳西大学,诺克斯维尔,美国) University of Tennessee-Oak Ridge Innovation Institute, University of Tennessee, Knoxville, USA(田纳西大学橡树岭创新研究所,田纳西大学,诺克斯维尔,美国)

专题命中 跨模态检索 :multi-modal(abstract)

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏