arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-08 至 2025-08-08 共收录 53 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 13 篇

2508.04963 2025-08-08 cs.IR cs.LG 78%

A Metric for MLLM Alignment in Large-scale Recommendation

Yubin Zhang, Yanhua Huang, Haiming Xu, Mingliang Qi, Chang Wang, Jiarui Jin, Xiangyuan Ren, Xiaodan Wang, Ruiwen Xu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 多模态评测 :MLLM(title);multimodal(abstract)

Comments Pre-print.Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04746 2025-08-08 cs.LG 78%

A Foundational Multi-Modal Model for Few-Shot Learning

Pengtao Dang, Tingbo Guo, Sha Cao, Chi Zhang

机构 * Oregon Health & Science University(俄勒冈健康与科学大学)

专题命中 多模态评测 :multi-modal(title,abstract)

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02255 2025-08-08 eess.AS cs.LG cs.MM cs.SD 73%

MidiCaps: A large-scale MIDI dataset with text captions

Jan Melechovsky, Abhinaba Roy, Dorien Herremans

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS

Comments Accepted in ISMIR2024

Journal ref Proceedings of ISMIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05019 2025-08-08 cs.CV cs.AI cs.LG 62%

Skin-SOAP: A Weakly Supervised Framework for Generating Structured SOAP Notes

Sadia Kamal, Tim Oates, Joy Wan

机构 * Department of Computer Science, University of Maryland, Baltimore County(计算机科学系,马里兰大学巴尔的摩县分校) Department of Dermatology, Johns Hopkins University School of Medicine(皮肤科系,约翰霍普金斯大学医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to IJCAI 2025 Workshops. arXiv admin note: substantial text overlap with arXiv:2506.10328

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05377 2025-08-08 cs.IR cs.MM 57%

Does Multimodality Improve Recommender Systems as Expected? A Critical Analysis and Future Directions

Hongyu Zhou, Yinan Zhang, Aixin Sun, Zhiqi Shen

专题命中 多模态评测 :multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17653 2025-08-08 cs.MM cs.IR 57%

QuMAB: Query-based Multi-Annotator Behavior Modeling with Reliability under Sparse Labels

Liyun Zhang, Zheng Lian, Hong Liu, Takanori Takebe, Yuta Nakashima

专题命中 多模态评测 :multimodal(abstract);分类 cs.MM

Comments 12 pages. arXiv admin note: substantial text overlap with arXiv:2503.15237

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09525 2025-08-08 cs.MM 57%

SimLabel: Similarity-Weighted Iterative Framework for Multi-annotator Learning with Missing Annotations

Liyun Zhang, Zheng Lian, Hong Liu, Takanori Takebe, Yuta Nakashima

专题命中 多模态评测 :multimodal(abstract);分类 cs.MM

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 3 篇

2508.05580 2025-08-08 cs.CV 83%

Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis

Kunyu Feng, Yue Ma, Xinhua Zhang, Boshi Liu, Yikuang Yuluo, Yinhan Zhang, Runtao Liu, Hongyu Liu, Zhiyuan Qin, Shanhui Mo, Qifeng Chen, Zeyu Wang

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua Univerisity(清华大学) Peking University(北京大学) Chongqing University(重庆大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 多模态Agent :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05492 2025-08-08 cs.LG cs.AI cs.MA 79%

MoMA: A Mixture-of-Multimodal-Agents Architecture for Enhancing Clinical Prediction Modelling

Jifan Gao, Mahmudur Rahman, John Caskey, Madeline Oguss, Ann O'Rourke, Randy Brown, Anne Stey, Anoop Mayampurath, Matthew M. Churpek, Guanhua Chen, Majid Afshar

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Northwestern University(西北大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07894 2025-08-08 math.OC 71%

Complexity Analysis of a Bicriteria Directed Multimodal Transportation Network Design Problem

Dominik Leib, Susanne Fritzler, Neele Leithäuser

专题命中 多模态Agent :multimodal(title)

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 8 篇

2408.01343 2025-08-08 cs.CV cs.AI cs.LG 86%

StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation

Bingyu Li, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * University of Science and Technology of China(科学技术大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05476 2025-08-08 eess.IV 82%

MM2CT: MR-to-CT translation for multi-modal image fusion with mamba

Chaohui Gong, Zhiying Wu, Zisheng Huang, Gaofeng Meng, Zhen Lei, Hongbin Liu

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06367 2025-08-08 cs.LG 78%

Does a Technique for Building Multimodal Representation Matter? -- Comparative Analysis

Maciej Pawłowski, Anna Wróblewska, Sylwia Sysko-Romańczuk

专题命中 多模态训练与对齐 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20766 2025-08-08 cs.CV 77%

Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback

Yang Chen, Yufan Shen, Wenxuan Huang, Sheng Zhou, Qunshu Lin, Xinyu Cai, Zhi Yu, Jiajun Bu, Botian Shi, Yu Qiao

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05213 2025-08-08 cs.CV 70%

Textual and Visual Guided Task Adaptation for Source-Free Cross-Domain Few-Shot Segmentation

Jianming Liu, Wenlong Qiu, Haitao Wei

机构 * School of Artificial Intelligence(人工智能学院) School of Digital Industry(数字产业学院) Jiangxi Normal University(江西师范大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 10 pages,Accepted at ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18576 2025-08-08 cs.AI cs.CL cs.CV 67%

SafeWork-R1: Coevolving Safety and Intelligence under the AI-45$^{\circ}$ Law

Shanghai AI Lab, :, Yicheng Bao, Guanxu Chen, Mingkang Chen, Yunhao Chen, Chiyu Chen, Lingjie Chen, Sirui Chen, Xinquan Chen, Jie Cheng, Yu Cheng, Dengke Deng, Yizhuo Ding, Dan Ding, Xiaoshan Ding, Yi Ding, Zhichen Dong, Lingxiao Du, Yuyu Fan, Xinshun Feng, Yanwei Fu, Yuxuan Gao, Ruijun Ge, Tianle Gu, Lujun Gui, Jiaxuan Guo, Qianxi He, Yuenan Hou, Xuhao Hu, Hong Huang, Kaichen Huang, Shiyang Huang, Yuxian Jiang, Shanzhe Lei, Jie Li, Lijun Li, Hao Li, Juncheng Li, Xiangtian Li, Yafu Li, Lingyu Li, Xueyan Li, Haotian Liang, Dongrui Liu, Qihua Liu, Zhixuan Liu, Bangwei Liu, Huacan Liu, Yuexiao Liu, Zongkai Liu, Chaochao Lu, Yudong Lu, Xiaoya Lu, Zhenghao Lu, Qitan Lv, Caoyuan Ma, Jiachen Ma, Xiaoya Ma, Zhongtian Ma, Lingyu Meng, Ziqi Miao, Yazhe Niu, Yuezhang Peng, Yuan Pu, Han Qi, Chen Qian, Xingge Qiao, Jingjing Qu, Jiashu Qu, Wanying Qu, Wenwen Qu, Xiaoye Qu, Qihan Ren, Qingnan Ren, Qingyu Ren, Jing Shao, Wenqi Shao, Shuai Shao, Dongxing Shi, Xin Song, Xinhao Song, Yan Teng, Xuan Tong, Yingchun Wang, Xuhong Wang, Shujie Wang, Xin Wang, Yige Wang, Yixu Wang, Yuanfu Wang, Futing Wang, Ruofan Wang, Wenjie Wang, Yajie Wang, Muhao Wei, Xiaoyu Wen, Fenghua Weng, Yuqi Wu, Yingtong Xiong, Xingcheng Xu, Chao Yang, Yue Yang, Yang Yao, Yulei Ye, Zhenyun Yin, Yi Yu, Bo Zhang, Qiaosheng Zhang, Jinxuan Zhang, Yexin Zhang, Yinqiang Zheng, Hefeng Zhou, Zhanhui Zhou, Pengyu Zhu, Qingzi Zhu, Yubo Zhu, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 47 pages, 18 figures, authors are listed in alphabetical order by their last names; v3 modifies minor issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03930 2025-08-08 cs.CL cs.AI 62%

GuARD: Effective Anomaly Detection through a Text-Rich and Graph-Informed Language Model

Yunhe Pang, Bo Chen, Fanjin Zhang, Yanghui Rao, Evgeny Kharlamov, Jie Tang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-Sen University(中山大学) Department of Computer Science and Technology(计算机科学与技术系) Tsinghua University(清华大学) Robert Bosch GmbH(博世集团)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted at KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04739 2025-08-08 q-bio.GN cs.LG 50%

CodonMoE: DNA Language Models for mRNA Analyses

Shiyi Du, Litian Liang, Jiayi Li, Carl Kingsford

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 5 篇

2308.00528 2025-08-08 cs.CL 79%

Unimodal Intermediate Training for Multimodal Meme Sentiment Classification

Muzhaffar Hazman, Susan McKeever, Josephine Griffith

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

Comments Accepted for Publication at RANLP2023

Journal ref https://aclanthology.org/2023.ranlp-1.55/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05077 2025-08-08 cs.LG cs.RO 78%

Analyzing the Impact of Multimodal Perception on Sample Complexity and Optimization Landscapes in Imitation Learning

Luai Abuelsamen, Temitope Lukman Adebanjo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他多模态 :multimodal(title,abstract)

Comments 9 pages, 1 figure, 1 table, theoretical analysis with empirical validation on PerAct implementation in MuJoCo simulation environment

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05009 2025-08-08 cs.AI cs.CL 62%

Can Large Language Models Integrate Spatial Data? Empirical Insights into Reasoning Strengths and Computational Weaknesses

Bin Han, Robert Wolfe, Anat Caspi, Bill Howe

机构 * University of Washington(华盛顿大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05104 2025-08-08 cs.RO 50%

Examining the legibility of humanoid robot arm movements in a pointing task

Andrej Lúčny, Matilde Antonj, Carlo Mazzola, Hana Hornáčková, Ana Farić, Kristína Malinovská, Michal Vavrecka, Igor Farkaš

机构 * Faculty of Mathematics, Physics Informatics, Comenius University Bratislava, Slovakia DIBRIS, University of Genoa, Genoa, Italy CONTACT, Italian Institute of Technology, Genoa, Italy Digital Health Dept., Nvision Systems \& Technologies, S.L., Barcelona, Spain Faculty of Education, University of Ljubljana, Slovenia

专题命中 其他多模态 :multimodal(abstract)

Comments Published at ICSR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12609 2025-08-08 physics.app-ph 50%

Theoretical modeling of the dynamic range of an elastic nanobeam under tension with a geometric nonlinearity

N. W. Welles, M. Ma, K. L. Ekinci, M. R. Paul

专题命中 其他多模态 :multimodal(abstract)

Comments 35 pages, 15 figures

Journal ref Journal of Applied Physics, 138, 054501 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏