arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-27 至 2025-08-27 共收录 44 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 4 篇

2507.05520 2025-08-27 cs.AI 74%

Architecting Clinical Collaboration: Multi-Agent Reasoning Systems for Multimodal Medical VQA

Karishma Thakrar, Shreyas Basavatia, Akshay Daftardar

机构 * Georgia Institute of Technology Atlanta, GA, USA(佐治亚理工学院)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13810 2025-08-27 cs.CV cs.AI cs.LG cs.RO 62%

CAD-Assistant: Tool-Augmented VLLMs as Generic CAD Task Solvers

Dimitrios Mallis, Ahmet Serdar Karadeniz, Sebastian Cavada, Danila Rukhovich, Niki Foteinopoulou, Kseniya Cherenkova, Anis Kacem, Djamila Aouada

机构 * SnT, University of Luxembourg(斯诺特研究所,卢森堡大学) Artec3D, Luxembourg(Artec3D,卢森堡)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04447 2025-08-27 cs.CV cs.RO 57%

DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge

Wenyao Zhang, Hongsi Liu, Zekun Qi, Yunnan Wang, Xinqiang Yu, Jiazhao Zhang, Runpei Dong, Jiawei He, Fan Lu, He Wang, Zhizheng Zhang, Li Yi, Wenjun Zeng, Xin Jin

机构 * SJTU(上海交通大学) EIT(欧洲研究所) THU(清华大学) Galbot PKU(北京大学) UIUC(伊利诺伊大学香槟分校) USTC(中国科学技术大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 9 篇

2508.18322 2025-08-27 cs.CV cs.AI 84%

Structures Meet Semantics: Multimodal Fusion via Graph Contrastive Learning

Jiangfeng Sun, Sihao He, Zhonghong Ou, Meina Song

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments 9 pages,7 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04633 2025-08-27 cs.CV cs.AI 84%

M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering

Yanshu Li, Yi Cao, Hongyang He, Qisen Cheng, Xiang Fu, Xi Xiao, Tianyang Wang, Ruixiang Tang

机构 * Brown University(布朗大学) University of Warwick(沃里克大学) Samsung US(三星美国分公司) Boston University(波士顿大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Rutgers University(罗格斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments COLM 2025, 30 pages, 10 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18551 2025-08-27 cs.LG 78%

BTW: A Non-Parametric Variance Stabilization Framework for Multimodal Model Integration

Jun Hou, Le Wang, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(计算机科学系,弗吉尼亚理工学院,布莱克斯堡,VA,美国) Department of Agricultural and Applied Economics, Virginia Tech, Blacksburg, VA, USA(农业与应用经济学系,弗吉尼亚理工学院,布莱克斯堡,VA,美国)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18886 2025-08-27 cs.CV 70%

Toward Robust Medical Fairness: Debiased Dual-Modal Alignment via Text-Guided Attribute-Disentangled Prompt Learning for Vision-Language Models

Yuexuan Xia, Benteng Ma, Jiang He, Zhiyong Wang, Qi Dou, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology(集成空天地海大数据应用技术国家工程实验室) Northwestern Polytechnical University(西北工业大学) Huiying Medical Technology Company Ltd.(慧影医疗技术有限公司) The School of Computer Science(计算机学院) The University of Sydney(悉尼大学) Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18297 2025-08-27 cs.CV cs.AI cs.CL 67%

Can VLMs Recall Factual Associations From Visual References?

Dhananjay Ashok, Ashutosh Chaubey, Hirona J. Arai, Jonathan May, Jesse Thomason

机构 * University of Southern California(南加州大学) Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments To appear at EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17367 2025-08-27 cs.CV cs.AI 62%

EVM-Fusion: An Explainable Vision Mamba Architecture with Neural Algorithmic Fusion

Zichuan Yang, Yongzhi Wang

机构 * School of Mathematical Sciences, Tongji University(数学科学学院,同济大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19209 2025-08-27 cs.CV 57%

OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation

Jianwen Jiang, Weihong Zeng, Zerong Zheng, Jiaqi Yang, Chao Liang, Wang Liao, Han Liang, Yuan Zhang, Mingyuan Gao

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Homepage: https://omnihuman-lab.github.io/v1_5/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16801 2025-08-27 cs.CV 57%

Decoupled Global-Local Alignment for Improving Compositional Understanding

Xiaoxing Hu, Kaicheng Yang, Jun Wang, Haoran Xu, Ziyong Feng, Yupei Wang

机构 * Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09487 2025-08-27 cs.CV 57%

Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness

Beier Zhu, Jiequan Cui, Hanwang Zhang, Chi Zhang

机构 * Nanyang Technological University(南洋理工大学) Westlake University(西湖大学)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 2 篇

2407.08249 2025-08-27 cs.NI cs.AI 79%

GeNet: A Multimodal LLM-Based Co-Pilot for Network Topology and Configuration

Beni Ifland, Elad Duani, Rubin Krief, Miro Ohana, Aviram Zilberman, Andres Murillo, Ofir Manor, Ortal Lavi, Hikichi Kenji, Asaf Shabtai, Yuval Elovici, Rami Puzis

机构 * 1 Ben Gurion University of the Negev, Software

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07410 2025-08-27 physics.ao-ph cs.AI 57%

Leveraging GNN to Enhance MEF Method in Predicting ENSO

Saghar Ganji, Ahmad Reza Labibzadeh, Alireza Hassani, Mohammad Naisipour

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

Comments 17 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏