arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-06 至 2025-08-06 共收录 64 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2508.03073 2025-08-06 eess.IV cs.CV 83%

Nexus-INR: Diverse Knowledge-guided Arbitrary-Scale Multimodal Medical Image Super-Resolution

Bo Zhang, JianFei Huo, Zheng Zhang, Wufan Wang, Hui Gao, Xiangyang Gong, Wendong Wang

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02886 2025-08-06 cs.CL 83%

Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models

Wenjie Luo, Ruocheng Li, Shanshan Zhu, Julian Perry

机构 * Fujian University of Technology(福建工程大学) Delta University for Science and Technology(科技大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20756 2025-08-06 cs.CL cs.AI cs.CV cs.LG cs.MM 83%

ADS-Edit: A Multimodal Knowledge Editing Dataset for Autonomous Driving Systems

Chenxi Wang, Jizhan Fang, Xiang Chen, Bozhong Tian, Ziwen Xu, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University,\ University - Ant \ Joint Laboratory of Knowledge Graph Hangzhou China Zhejiang University,\ University - Ant \ Joint Laboratory of Knowledge Graph

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15882 2025-08-06 cs.CV cs.AI cs.CL cs.LG 82%

Document Haystack: A Long Context Multimodal Image/Document Understanding Vision LLM Benchmark

Goeric Huybrechts, Srikanth Ronanki, Sai Muralidhar Jayanthi, Jack Fitzgerald, Srinivasan Veeravanallur

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03008 2025-08-06 eess.IV cs.AI cs.CV 81%

ClinicalFMamba: Advancing Clinical Assessment using Mamba-based Multimodal Neuroimaging Fusion

Meng Zhou, Farzad Khalvati

机构 * TD Bank Group, Toronto, Canada(TD银行集团,加拿大) Department of Computer Science, University of Toronto, Toronto, Canada(多伦多大学计算机科学系,加拿大) Department of Medical Imaging, University of Toronto, Toronto, Canada(多伦多大学医学影像系,加拿大)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at MICCAI MLMI 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22676 2025-08-06 cs.CL cs.MM 81%

Listening to the Unspoken: Exploring "365" Aspects of Multimodal Interview Performance Assessment

Jia Li, Yang Wang, Wenhao Qian, Jialong Hu, Zhenzhen Hu, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments 8 pages, 4 figures, ACM MM 2025. github:https://github.com/MSA-LMC/365Aspects

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03173 2025-08-06 cs.AI 79%

Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions

Jingxuan Wei, Caijun Jia, Qi Chen, Honghao He, Linzhuang Sun, Conghui He, Lijun Wu, Bihui Yu, Cheng Tan

机构 * Shenyang institute of computing technology, Chinese academy of sciences(沈阳计算技术研究所,中国科学院) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02957 2025-08-06 eess.IV cs.CV 79%

AMD-Mamba: A Phenotype-Aware Multi-Modal Framework for Robust AMD Prognosis

Puzhen Wu, Mingquan Lin, Qingyu Chen, Emily Y. Chew, Zhiyong Lu, Yifan Peng, Hexin Dong

机构 * Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,韦尔·柯林斯医学中心) Department of Surgery, University of Minnesota(外科系,明尼苏达大学) Department of Biomedical Informatics and Data Science, Yale School of Medicine(生物医学信息学与数据科学系,耶鲁医学院) National Eye Institute, National Institutes of Health(国家眼科研究所,国立卫生研究院) National Library of Medicine, National Institutes of Health(国家医学图书馆,国立卫生研究院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted at the MICCAI 2025 MIML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02951 2025-08-06 cs.AI 79%

MedBLINK: Probing Basic Perception in Multimodal Language Models for Medicine

Mahtab Bigverdi, Wisdom Ikezogwo, Kevin Zhang, Hyewon Jeong, Mingyu Lu, Sungjae Cho, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Massachusetts Institute of Technology(麻省理工学院) Seoul National University(首尔国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20466 2025-08-06 cs.CV 79%

LMME3DHF: Benchmarking and Evaluating Multimodal 3D Human Face Generation with LMMs

Woo Yi Yang, Jiarui Wang, Sijing Wu, Huiyu Duan, Yuxin Zhu, Liu Yang, Kang Fu, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03046 2025-08-06 cs.LG 78%

A Novel Multimodal Framework for Early Detection of Alzheimers Disease Using Deep Learning

Tatwadarshi P Nagarhalli, Sanket Patil, Vishal Pande, Uday Aswalekar, Prafulla Patil

专题命中 多模态评测 :multimodal(title,abstract)

Comments Journal paper, 14 pages

Journal ref SSRG International Journal of Electronics and Communication Engineering, Volume 11 Issue 11, November 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02847 2025-08-06 eess.SP cs.SY eess.IV eess.SY 78%

Integrating Machine Learning with Multimodal Monitoring System Utilizing Acoustic and Vision Sensing to Evaluate Geometric Variations in Laser Directed Energy Deposition

Ke Xu, Chaitanya Krishna Prasad Vallabh, Souran Manoochehri

专题命中 多模态评测 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18148 2025-08-06 cs.CL cs.AI cs.LG 76%

NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous Scripts

Muhammad Farid Adilazuarda, Musa Izzanardi Wijanarko, Lucky Susanto, Khumaisa Nur'aini, Derry Wijaya, Alham Fikri Aji

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03560 2025-08-06 cs.SE 67%

LaTCoder: Converting Webpage Design to Code with Layout-as-Thought

Yi Gui, Zhen Li, Zhongyi Zhang, Guohao Wang, Tianpeng Lv, Gaoyang Jiang, Yi Liu, Dongping Chen, Yao Wan, Hongyu Zhang, Wenbin Jiang, Xuanhua Shi, Hai Jin

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

Comments KDD 2025 v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12248 2025-08-06 cs.CV 57%

Neuro-3D: Towards 3D Visual Decoding from EEG Signals

Zhanqiang Guo, Jiamin Wu, Yonghao Song, Jiahui Bu, Weijian Mai, Qihao Zheng, Wanli Ouyang, Chunfeng Song

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03278 2025-08-06 cond-mat.mtrl-sci cs.AI physics.app-ph 57%

Artificial Intelligence and Generative Models for Materials Discovery -- A Review

Albertus Denny Handoko, Riko I Made

机构 * Institute of Sustainability for Chemicals, Energy and Environment (ISCE 2 )(化学、能源与环境可持续性研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Institute of Materials Research and Engineering (IMRE)(材料研究与工程研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

Comments Review Article in the Thematic Issue on Artificial Intelligence for Materials Discovery in World Scientific Annual Review of Functional Materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00991 2025-08-06 cs.CV 57%

GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs

Xiaorong Zhu, Ziheng Jia, Jiarui Wang, Xiangyu Zhao, Haodong Duan, Xiongkuo Min, Jia Wang, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08253 2025-08-06 cs.CV 57%

Knowledge Distillation for Underwater Feature Extraction and Matching via GAN-synthesized Images

Jinghe Yang, Mingming Gong, Ye Pu

机构 * Department of Electrical and Electronic Engineering, The University of Melbourne(电气与电子工程系,墨尔本大学) School of Mathematics and Statistics, The University of Melbourne(数学与统计学系,墨尔本大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

Journal ref IEEE Robotics and Automation Letters, vol. 10, no. 9, pp. 8866-8873, Sept. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03456 2025-08-06 q-bio.BM 50%

Decoding Polyphenol-Protein Interactions with Deep Learning: From Molecular Mechanisms to Food Applications

Qiang Liu, Tiantian Wang, Binbin Nian, Feiyang Ma, Siqi Zhao, Andrés F. Vásquez, Liping Guo, Chao Ding, Mehdi D. Davari

专题命中 多模态评测 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19781 2025-08-06 cs.RO cs.NI 50%

The Starlink Robot: A Platform and Dataset for Mobile Satellite Communication

Boyi Liu, Qianyi Zhang, Qiang Yang, Jianhao Jiao, Jagmohan Chauhan, Dimitrios Kanoulas

机构 * University College London(伦敦大学学院) University of Cambridge(剑桥大学)

专题命中 多模态评测 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 3 篇

2508.02841 2025-08-06 cs.AI cs.IR 77%

A Multi-Agent System for Complex Reasoning in Radiology Visual Question Answering

Ziruo Yi, Jinyu Liu, Ting Xiao, Mark V. Albert

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03345 2025-08-06 cs.AI 57%

Adaptive AI Agent Placement and Migration in Edge Intelligence Systems

Xingdan Wang, Jiayi He, Zhiqing Tang, Jianxiong Guo, Jiong Lou, Liping Qian, Tian Wang, Weijia Jia

机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University, China(人工智能与未来网络研究院,北京师范大学,中国) Faculty of Arts and Sciences, Beijing Normal University, China(文理学院,北京师范大学,中国) Department of Computer Science and Engineering, Shanghai Jiao Tong University, China(计算机科学与工程系,上海交通大学,中国) College of Information Engineering, Zhejiang University of Technology, China(信息工程学院,浙江工业大学,中国)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02976 2025-08-06 cs.RO 50%

Physics-informed Neural Time Fields for Prehensile Object Manipulation

Hanwen Ren, Ruiqi Ni, Ahmed H. Qureshi

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 多模态Agent :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 5 篇

2508.03102 2025-08-06 cs.CV 83%

Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning

Tianjiao Jiang, Zhen Zhang, Yuhang Liu, Javen Qinfeng Shi

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) The University of Adelaide(阿德莱德大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01455 2025-08-06 cs.CV cs.AI cs.LG 81%

Automatic Fused Multimodal Deep Learning for Plant Identification

Alfreds Lapkovskis, Natalia Nefedova, Ali Beikmohammadi

机构 * Department of Computer and Systems Sciences(计算机与系统科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Journal ref Front. Plant Sci., 05 August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08344 2025-08-06 cs.CV 79%

MM-Gesture: Towards Precise Micro-Gesture Recognition through Multimodal Fusion

Jihao Gu, Fei Wang, Kun Li, Yanyan Wei, Zhiliang Wu, Dan Guo

机构 * University College London (UCL)(伦敦大学学院) School of Computer Science(计算机科学学院) Information Engineering, School of Artificial Intelligence, Hefei University of Technology (HFUT)(信息工程学院,人工智能学院,合肥工业大学) ReLER, CCAI, Zhejiang University, China(ReLER、CCAI、浙江大学,中国) Key Laboratory of Knowledge Engineering with Big Data (HFUT), Ministry of Education(大数据知识工程重点实验室(HFUT),教育部) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, China(人工智能研究所,合肥综合性国家科学中心,中国) Xinsight Lab, Research Institute, Hefei Zhongjuyuan Intelligent Technology Co., Ltd., China(Xinsight实验室,研究院,合肥中睿智能科技有限公司,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments 1st Place in Micro-gesture Classification sub-challenge in 3rd MiGA at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02562 2025-08-06 cs.CV cs.AI cs.CY cs.LG 62%

Beyond Images: Adaptive Fusion of Visual and Textual Data for Food Classification

Prateek Mittal, Puneet Goyal, Joohi Chauhan

机构 * Motilal Nehru National Institute of Technology Allahabad, India(Motilal Nehru国立技术学院Allahabad分校) Indian Institute of Technology Ropar, India(印度理工学院Ropar分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03277 2025-08-06 cs.CV 57%

Efficient Multi-Slide Visual-Language Feature Fusion for Placental Disease Classification

Hang Guo, Qing Zhang, Zixuan Gao, Siyuan Yang, Shulin Peng, Xiang Tao, Ting Yu, Yan Wang, Qingli Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted by ACMMM'25

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 6 篇

2411.17471 2025-08-06 cs.LG cs.CR cs.CV 83%

Learning New Concepts, Remembering the Old: Continual Learning for Multimodal Concept Bottleneck Models

Songning Lai, Mingqian Liao, Zhangyi Hu, Jiayu Yang, Wenshuo Chen, Hongru Xiao, Jianheng Tang, Haicheng Liao, Yutao Yue

机构 * HKUST(GZ) Deep Interdisciplinary Intelligence Lab(香港科技大学(广州)深度跨学科智能实验室) Wuhan University(武汉大学) Shandong University(山东大学) Tongji University(同济大学) Peking University(北京大学) University of Macau(澳门大学) HKUST(GZ) Institute of Deep Perception Technology, JITRI Deep Interdisciplinary Intelligence Lab(香港科技大学(广州)感知技术研究所,JITRI深度跨学科智能实验室)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Journal ref ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03517 2025-08-06 cs.CR 78%

Intrusion Detection in Heterogeneous Networks with Domain-Adaptive Multi-Modal Learning

Mabin Umman Varghese, Zahra Taghiyarrenani

专题命中 其他多模态 :multi-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏