arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-14 至 2025-08-14 共收录 66 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 11 篇

2508.09444 2025-08-14 cs.RO cs.CV 57%

DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation

Haoxiang Shi, Xiang Deng, Zaijing Li, Gongwei Chen, Yaowei Wang, Liqiang Nie

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12724 2025-08-14 cs.RO 50%

Responsive Noise-Relaying Diffusion Policy: Responsive and Efficient Visuomotor Control

Zhuoqun Chen, Xiu Yuan, Tongzhou Mu, Hao Su

机构 * UC San Diego(UC圣地亚哥大学)

专题命中 多模态生成 :multi-modal(abstract)

Comments Project website: https://rnr-dp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 15 篇

2508.09641 2025-08-14 cs.CE 82%

VisFinEval: A Scenario-Driven Chinese Multimodal Benchmark for Holistic Financial Understanding

Zhaowei Liu, Xin Guo, Haotian Xia, Lingfeng Zeng, Fangqi Lou, Jinyi Niu, Mengping Li, Qi Qi, Jiahuan Li, Wei Zhang, Yinglong Wang, Weige Cai, Weining Shen, Liwen Zhang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09864 2025-08-14 cs.LG cs.AI cs.CL cs.CV 82%

LUMA: A Benchmark Dataset for Learning from Uncertain and Multimodal Data

Grigor Bezirganyan, Sana Sellami, Laure Berti-Équille, Sébastien Fournier

机构 * Aix Marseille Univ, CNRS, LIS(阿维尼翁-马赛大学、国家科学研究中心、LIS)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments SIGIR 2025

Journal ref Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08224 2025-08-14 cs.CL cs.AI 81%

Capabilities of GPT-5 on Multimodal Medical Reasoning

Shansong Wang, Mingzhe Hu, Qiang Li, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科、Winship癌症研究所、埃默里大学医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Corrected some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12207 2025-08-14 cs.CV cs.AI 81%

Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind

Qingmei Li, Yang Zhang, Zurong Mai, Yuhang Chen, Shuohong Lou, Henglian Huang, Jiarui Zhang, Zhiwei Zhang, Yibin Wen, Weijia Li, Haohuan Fu, Jianxi Huang, Juepeng Zheng

机构 * Tsinghua University(清华大学) Sun Yat-Sen University(中山大学) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09715 2025-08-14 cs.CV cs.LG 79%

NEURAL: Attention-Guided Pruning for Unified Multimodal Resource-Constrained Clinical Evaluation

Devvrat Joshi, Islem Rekik

机构 * BASIRA Lab, Imperial-X (I-X) and Department of Computing, Imperial College London(BASIRA实验室、Imperial-X(I-X)及帝国理工学院计算机系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08071 2025-08-14 cs.LG cs.AI 79%

C-MAG: Cascade Multimodal Attributed Graphs for Supply Chain Link Prediction

Yunqing Li, Zixiang Tang, Jiaying Zhuang, Zhenyu Yang, Farhad Ameri, Jianbang Zhang

机构 * School of Manufacturing Systems and Networks, Arizona State University(制造系统与网络学院,亚利桑那州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments https://openreview.net/pdf?id=mE5n6OJHwO

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19256 2025-08-14 cs.CV cs.RO 79%

LM-MCVT: A Lightweight Multi-modal Multi-view Convolutional-Vision Transformer Approach for 3D Object Recognition

Songsong Xiong, Hamidreza Kasaei

机构 * Department of Artificial Intelligence, University of Groningen(人工智能系,格罗宁根大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09155 2025-08-14 cs.LG cs.AI 79%

A Rolling Stone Gathers No Moss: Adaptive Policy Optimization for Stable Self-Evaluation in Large Multimodal Models

Wenkai Wang, Hongcan Guo, Zheqi Lv, Shengyu Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09342 2025-08-14 cs.HC 78%

Affordances of Sketched Notations for Multimodal UI Design and Development Tools

Sam H. Ross, Yunseo Lee, Coco K. Lee, Jayne Everson, R. Benjamin Shapiro

专题命中 多模态评测 :multimodal(title,abstract)

Comments VL/HCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09966 2025-08-14 cs.CV cs.AI 76%

January Food Benchmark (JFB): A Public Benchmark Dataset and Evaluation Suite for Multimodal Food Analysis

Amir Hosseinian, Ashkan Dehghani Zahedani, Umer Mansoor, Noosheen Hashemi, Mark Woodward

机构 * January AI

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07817 2025-08-14 eess.IV cs.AI cs.CV cs.LG cs.MM 75%

MIND: A Noise-Adaptive Denoising Framework for Medical Images Integrating Multi-Scale Transformer

Tao Tang, Chengxu Yang

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by the 7th International Conference on Intelligent Control, Measurement and Signal Processing (ICMSP 2025). 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00938 2025-08-14 cs.IR cs.AI cs.DB 74%

WebArXiv: Evaluating Multimodal Agents on Time-Invariant arXiv Tasks

Zihao Sun, Ling Chen

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

Comments 10 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09593 2025-08-14 cs.CV cs.AI 73%

Hierarchical Brain Structure Modeling for Predicting Genotype of Glioma

Haotian Tang, Jianwei Chen, Xinrui Tang, Yunjia Wu, Zhengyang Miao, Chao Li

机构 * College of Medicine and Biological Information Engineering, Northeastern University, Liaoning, China(医学与生物信息工程学院,东北大学,辽宁,中国) School of Science and Engineering, University of Dundee, Dundee, UK(科学与工程学院,邓迪大学,邓迪,英国) School of Medicine, University of Dundee, Dundee, UK(医学院,邓迪大学,邓迪,英国) Department of Applied Maths and Theoretical Physics, University of Cambridge, Cambridge, UK(应用数学与理论物理系,剑桥大学,剑桥,英国)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09152 2025-08-14 cs.NI cs.AI cs.LG 57%

5G Core Fault Detection and Root Cause Analysis using Machine Learning and Generative AI

Joseph H. R. Isaac, Harish Saradagam, Nallamothu Pardhasaradhi

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

Comments 8 pages, 3 figures and 2 tables. Accepted in Conference on Advances in Communication Networks & Systems (CoaCoNS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19125 2025-08-14 stat.ML cs.LG math.ST stat.CO stat.ME stat.TH 50%

A spectral method for multi-view subspace learning using the product of projections

Renat Sergazinov, Armeen Taeb, Irina Gaynanova

机构 * Department of Statistics, Texas A\&M University, College Station, TX(统计学系,德克萨斯A&M大学,College Station) Department of Statistics, University of Washington, Seattle, WA(统计学系,华盛顿大学,Seattle) Department of Biostatistics, University of Michigan, Ann Arbor, MI(生物统计学系,密歇根大学,Ann Arbor)

专题命中 多模态评测 :multimodal(abstract)

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 4 篇

2505.00586 2025-08-14 cs.RO cs.LG 71%

ParkDiffusion: Heterogeneous Multi-Agent Multi-Modal Trajectory Prediction for Automated Parking using Diffusion Models

Jiarong Wei, Niclas Vödisch, Anna Rehr, Christian Feist, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE(CARIAD公司)

专题命中 多模态Agent :multi-modal(title)

Comments IROS 2025 Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09858 2025-08-14 cs.CV 57%

HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics

Weiqi Li, Zehao Zhang, Liang Lin, Guangrun Wang

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09318 2025-08-14 cs.LO cs.AI 57%

TPTP World Infrastructure for Non-classical Logics

Alexander Steen, Geoff Sutcliffe

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09836 2025-08-14 cs.RO 50%

Embodied Tactile Perception of Soft Objects Properties

Anirvan Dutta, Alexis WM Devillard, Zhihuan Zhang, Xiaoxiao Cheng, Etienne Burdet

专题命中 多模态Agent :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 8 篇

2501.03012 2025-08-14 cs.AI cs.CL cs.CV 85%

Analyzing Finetuning Representation Shift for Multimodal LLMs Steering

Pegah Khayatan, Mustafa Shukor, Jayneel Parekh, Arnaud Dapogny, Matthieu Cord

机构 * ISIR, Sorbonne Université(ISIR,索邦大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICCV 2025. The first three authors contributed equally. Project page and code: https://pegah- kh.github.io/projects/lmm-finetuning-analysis-and-steering/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09717 2025-08-14 cs.CV cs.LG 79%

Multimodal Sheaf-based Network for Glioblastoma Molecular Subtype Prediction

Shekhnaz Idrissova, Islem Rekik

机构 * BASIRA Lab, Imperial-X(BASIRA实验室、Imperial-X) Department of Computing, Imperial College London, United Kingdom(计算系、帝国理工学院伦敦分校,英国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09182 2025-08-14 eess.IV cs.CV 79%

MedPatch: Confidence-Guided Multi-Stage Fusion for Multimodal Clinical Data

Baraa Al Jorf, Farah Shamout

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09664 2025-08-14 cs.IR 78%

Multimodal Fusion And Sparse Attention-based Alignment Model for Long Sequential Recommendation

Yongrui Fu, Jian Liu, Tao Li, Zonggang Wu, Shouke Qin, Hanmeng Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09941 2025-08-14 cs.LG cs.AI 70%

FedRecon: Missing Modality Reconstruction in Heterogeneous Distributed Environments

Junming Liu, Yanting Gao, Yifei Sun, Yufei Jin, Yirong Chen, Ding Wang, Guosun Zeng

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments 21 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09802 2025-08-14 cs.CV 57%

MUJICA: Reforming SISR Models for PBR Material Super-Resolution via Cross-Map Attention

Xin Du, Maoyuan Xu, Zhi Ying

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14332 2025-08-14 cs.CV 57%

ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs

Yin Xie, Kaicheng Yang, Peirou Liang, Xiang An, Yongle Zhao, Yumeng Wang, Ziyong Feng, Roy Miles, Ismail Elezi, Jiankang Deng

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09227 2025-08-14 cs.LG cs.AI cs.CE 57%

GSMT: Graph Fusion and Spatiotemporal TaskCorrection for Multi-Bus Trajectory Prediction

Fan Ding, Hwa Hui Tew, Junn Yong Loo, Susilawati, LiTong Liu, Fang Yu Leong, Xuewen Luo, Kar Keong Chin, Jia Jun Gan

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) School of Engineering, Monash University Malaysia(墨尔本大学马来西亚分校工程学院) Perunding Atur Trafik Sdn Bhd, Malaysia(马来西亚交通自动化有限公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments This paper has been accepted by ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他多模态 7 篇

2508.09195 2025-08-14 eess.IV cs.AI cs.CV 81%

impuTMAE: Multi-modal Transformer with Masked Pre-training for Missing Modalities Imputation in Cancer Survival Prediction

Maria Boyko, Aleksandra Beliaeva, Dmitriy Kornilov, Alexander Bernstein, Maxim Sharaev

机构 * Center for Applied AI, Skolkovo Institute of Science and Technology, Moscow, Russian Federation(应用人工智能中心,斯克尔科夫科学与技术研究所,莫斯科,俄罗斯联邦) BIMAI-Lab, Biomedically Informed Artificial Intelligence Laboratory, University of Sharjah, Sharjah, United Arab Emirates(BIMAI实验室,生物医学导向人工智能实验室,肖贾联合大学,肖贾,阿拉伯联合酋长国) Ivannikov Institute for System Programming of the Russian Academy of Sciences, Moscow, Russian Federation(伊万诺夫俄罗斯科学院系统编程研究所,莫斯科,俄罗斯联邦)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏