arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-17 至 2025-11-17 共收录 63 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 14 篇

2511.11299 2025-11-17 cs.CV cs.AI 81%

AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models

Haokun Chen, Jianing Li, Yao Zhang, Jinhe Bi, Yan Xia, Jindong Gu, Volker Tresp

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

Comments AAAI 2026. Code: https://github.com/HaokunChen245/AUVIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10521 2025-11-17 cs.AI cs.CL 81%

Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning

Yuhao Zhou, Yiheng Wang, Xuming He, Ao Shen, Ruoyao Xiao, Zhiwei Li, Qiantai Feng, Zijie Guo, Yuejin Yang, Hao Wu, Wenxuan Huang, Jiaqi Wei, Dan Si, Xiuqi Yao, Jia Bu, Haiwen Huang, Manning Wang, Tianfan Fu, Shixiang Tang, Ben Fei, Dongzhan Zhou, Fenghua Ling, Yan Lu, Siqi Sun, Chenhui Li, Guanjie Zheng, Jiancheng Lv, Wenlong Zhang, Lei Bai

机构 * PrismaX Team Shanghai Artificial Intelligence Laboratory(普斯玛X团队上海人工智能实验室)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CL、cs.AI

Comments 82 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11034 2025-11-17 cs.CV cs.AI 81%

CrossMed: A Multimodal Cross-Task Benchmark for Compositional Generalization in Medical Imaging

Pooja Singh, Siddhant Ujjain, Tapan Kumar Gandhi, Sandeep Kumar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10690 2025-11-17 cs.CL cs.AI 81%

Saying the Unsaid: Revealing the Hidden Language of Multimodal Systems Through Telephone Games

Juntu Zhao, Jialing Zhang, Chongxuan Li, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025 MTI-LLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16926 2025-11-17 cs.CV cs.CL 81%

Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input

Chenxu Li, Zhicai Wang, Yuan Sheng, Xingyu Zhu, Yanbin Hao, Xiang Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00060 2025-11-17 cs.CV cs.AI 81%

MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image

Shezheng Song, Chengxiang He, Shan Zhao, Chengyu Wang, Qian Wan, Tianwei Yan, Meng Wang

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) School of Computer and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) CCNU(中国地质大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11486 2025-11-17 cs.CV q-bio.QM 79%

Multimodal Posterior Sampling-based Uncertainty in PD-L1 Segmentation from H&E Images

Roman Kinakh, Gonzalo R. Ríos-Muñoz, Arrate Muñoz-Barrutia

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Preprint (pre-review). Accepted for publication in Lecture Notes in Bioinformatics (Springer, 2025). The final authenticated version will be available on SpringerLink once published

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11438 2025-11-17 cs.CV 79%

VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models

Mingjie Xu, Jinpeng Chen, Yuzhi Zhao, Jason Chun Lok Li, Yue Qiu, Zekang Du, Mengyang Wu, Pingping Zhang, Kun Li, Hongzheng Yang, Wenao Ma, Jiaheng Wei, Qinbin Li, Kangcheng Liu, Wenqiang Lei

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11410 2025-11-17 cs.CV 79%

Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models

Jiaxi Huang, Dongxu Wu, Hanwei Zhu, Lingyu Zhu, Jun Xing, Xu Wang, Baoliang Chen

机构 * South China Normal University(华南师范大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Shenzhen Academy of Inspection and Quarantine(深圳检验检疫局) Shenzhen University(深圳大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09914 2025-11-17 cs.AI 79%

OIDA-QA: A Multimodal Benchmark for Analyzing the Opioid Industry Documents Archive

Xuan Shen, Brian Wingenroth, Zichao Wang, Jason Kuen, Wanrong Zhu, Ruiyi Zhang, Yiwei Wang, Lichun Ma, Anqi Liu, Hongfu Liu, Tong Sun, Kevin S. Hawkins, Kate Tasker, G. Caleb Alexander, Jiuxiang Gu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments Accepted by AAAI 2026 Artificial Intelligence for Social Impact Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15846 2025-11-17 cs.CL 79%

CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation

Chenchen Kuai, Chenhao Wu, Yang Zhou, Xiubin Bruce Wang, Tianbao Yang, Zhengzhong Tu, Zihao Li, Yunlong Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25434 2025-11-17 cs.CL 57%

A Critical Study of Automatic Evaluation in Sign Language Translation

Shakib Yazdani, Yasser Hamidullah, Cristina España-Bonet, Eleftherios Avramidis, Josef van Genabith

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

Comments Submitted to the LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 5 篇

2511.11182 2025-11-17 cs.AI cs.CL cs.MA cs.MM 82%

Multi-agent Undercover Gaming: Hallucination Removal via Counterfactual Test for Multimodal Reasoning

Dayong Liang, Xiao-Yong Wei, Changmeng Zheng

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11257 2025-11-17 cs.AI cs.CE cs.LG 79%

AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery

Yuqi Yin, Yibo Fu, Siyuan Wang, Peng Sun, Hongyu Wang, Xiaohui Wang, Lei Zheng, Zhiyong Li, Zhirong Liu, Jianji Wang, Zhaoxi Sun

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09956 2025-11-17 cs.LG cs.AI cs.CV cs.ET 62%

DeepSeek-Inspired Exploration of RL-based LLMs and Synergy with Wireless Networks: A Survey

Yu Qiao, Phuong-Nam Tran, Ji Su Yoon, Loc X. Nguyen, Eui-Nam Huh, Dusit Niyato, Choong Seon Hong

机构 * Kyung Hee University(韩国庆熙大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

Comments 45 pages, 12 figures

Journal ref ACM Computing Surveys, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10705 2025-11-17 cs.AI cs.CL 62%

Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents

Yuan Zhao, Hualei Zhu, Tingyu Jiang, Shen Li, Xiaohang Xu, Hao Henry Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00108 2025-11-17 cs.LG cs.AI cs.RO 57%

Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence

Yi Zhang, Che Liu, Xiancong Ren, Hanchu Ni, Shuai Zhang, Zeyuan Ding, Jiayu Hu, Hanzhe Shan, Zhenwei Niu, Zhaoyang Liu, Shuang Liu, Yue Zhao, Junbo Qi, Qinfan Zhang, Dengjie Li, Yidong Wang, Jiachen Luo, Yong Dai, Zenglin Xu, Bin Shen, Qifan Wang, Jian Tang, Xiaozhu Ju

机构 * WFM System Group(WFM系统组) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京人形机器人创新中心(X-Humanoid))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 12 篇

2511.10671 2025-11-17 cs.CL cs.CV 84%

Grounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual Consistency

Filippo Morbiato, Luca Romano, Alessandro Persona

机构 * University of Padua(帕多瓦大学)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10568 2025-11-17 cs.LG cs.AI cs.CL cs.CV 82%

MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion

Ruixiang Jiang, Lingbo Liu, Changwen Chen

机构 * Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) Research Institute of Multiple Agents and Embodied Intelligence, Pengcheng Laboratory(多智能体与具身智能研究院,鹏城实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11452 2025-11-17 q-bio.QM cs.CV cs.LG eess.IV 79%

Synergy vs. Noise: Performance-Guided Multimodal Fusion For Biochemical Recurrence-Free Survival in Prostate Cancer

Seth Alain Chang, Muhammad Mueez Amjad, Noorul Wahab, Ethar Alzaid, Nasir Rajpoot, Adam Shephard

机构 * Tissue Image Analytics Centre, Department of Computer Science, University of Warwick, UK(沃里克大学计算机科学系组织图像分析中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments 5 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26289 2025-11-17 cs.MM 79%

Contribution-Guided Asymmetric Learning for Robust Multimodal Fusion under Imbalance and Noise

Zijing Xu, Yunfeng Kou, Kunming Wu, Hong Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06452 2025-11-17 cs.LG 78%

MULTIBENCH++: A Unified and Comprehensive Multimodal Fusion Benchmarking Across Specialized Domains

Leyan Xue, Changqing Zhang, Kecheng Xue, Xiaohong Liu, Guangyu Wang, Zongbo Han

专题命中 多模态训练与对齐 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04870 2025-11-17 cs.LG 78%

NTSFormer: A Self-Teaching Graph Transformer for Multimodal Isolated Cold-Start Node Classification

Jun Hu, Yufei He, Yuan Li, Bryan Hooi, Bingsheng He

专题命中 多模态训练与对齐 :multimodal(title,abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11126 2025-11-17 cs.CL cs.CV 73%

Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion

Yi Shi, Wenlong Meng, Zhenyuan Guo, Chengkun Wei, Wenzhi Chen

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10046 2025-11-17 cs.CV 70%

FreDFT: Frequency Domain Fusion Transformer for Visible-Infrared Object Detection

Wencong Wu, Xiuwei Zhang, Hanlin Yin, Shun Dai, Hongxi Zhang, Yanning Zhang

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11422 2025-11-17 cs.CV 57%

Shrinking the Teacher: An Adaptive Teaching Paradigm for Asymmetric EEG-Vision Alignment

Lukun Wu, Jie Li, Ziqi Ren, Kaifan Zhang, Xinbo Gao

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 21pages,12 figures,published to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10560 2025-11-17 cs.CV 57%

OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer

Haosong Peng, Hao Li, Yalun Dai, Yushi Lan, Yihang Luo, Tianyu Qi, Zhengshen Zhang, Yufeng Zhan, Junfei Zhang, Wenchao Xu, Ziwei Liu

机构 * HKUST(香港科技大学) NTU(国立台湾大学) SYSU(南方科技大学) NUS(国立新加坡大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Project Page: https://livioni.github.io/OmniVGGT-official/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15888 2025-11-17 cs.CV 57%

MS-Occ: Multi-Stage LiDAR-Camera Fusion for 3D Semantic Occupancy Prediction

Zhiqiang Wei, Lianqing Zheng, Jianan Liu, Tao Huang, Qing-Long Han, Wenwen Zhang, Fengdeng Zhang

机构 * School of Optical-Electrical and Computer Engineering, University of Shanghai for Science and Technology(光学电子与计算机工程学院,上海科学技术大学) School of Automotive Studies, Tongji University(汽车学院,同济大学) Momoni AI College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) School of Engineering, Swinburne University of Technology(工程学院,斯威本技术大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电气与电子工程学院,南洋理工大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10935 2025-11-17 cs.SD cs.LG q-bio.NC 50%

CAT-Net: A Cross-Attention Tone Network for Cross-Subject EEG-EMG Fusion Tone Decoding

Yifan Zhuang, Calvin Huang, Zepeng Yu, Yongjie Zou, Jiawei Ju

专题命中 多模态训练与对齐 :multimodal(abstract)

Comments This is the extended version with technical appendices. The version of record appears in AAAI-26. Please cite the AAAI version

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2511.11212 2025-11-17 cs.CV 79%

MAFM^3: Modular Adaptation of Foundation Models for Multi-Modal Medical AI

Mohammad Areeb Qazi, Munachiso S Nwadike, Ibrahim Almakky, Mohammad Yaqub, Numan Saeed

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫罕默德·本·扎耶德人工智能大学)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

Comments 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏