arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-18 至 2025-11-18 共收录 30 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 30 篇

2511.13242 2025-11-18 cs.CV 83%

MMD-Thinker: Adaptive Multi-Dimensional Thinking for Multimodal Misinformation Detection

Junjie Wu, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05982 2025-11-18 cs.CV 83%

MCA-Bench: A Multimodal Benchmark for Evaluating CAPTCHA Robustness Against VLM-based Attacks

Zonglin Wu, Yule Xue, Yaoyao Feng, Xiaolong Wang, Yiren Song

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments we update the paper supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09415 2025-11-18 cs.CV 83%

FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models

Hongyang Wang, Yichen Shi, Zhuofu Tao, Yuhao Gao, Liepiao Zhang, Xun Lin, Jun Feng, Xiaochen Yuan, Zitong Yu, Xiaochun Cao

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by AAAI 2025. Hongyang Wang and Yichen Shi contribute equally. Corresponding author: Zitong Yu

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13248 2025-11-18 cs.CR 82%

DualTAP: A Dual-Task Adversarial Protector for Mobile MLLM Agents

Fuyao Zhang, Jiaming Zhang, Che Wang, Xiongtao Sun, Yurong Hao, Guowei Guan, Wenjie Li, Longtao Huang, Wei Yang Bryan Lim

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13259 2025-11-18 cs.CV cs.AI 81%

GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models

Yushuo Zheng, Jiangyong Ying, Huiyu Duan, Chunyi Li, Zicheng Zhang, Jing Liu, Xiaohong Liu, Guangtao Zhai

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09894 2025-11-18 cs.AI cs.CV cs.LG 81%

EgoEMS: A High-Fidelity Multimodal Egocentric Dataset for Cognitive Assistance in Emergency Medical Services

Keshara Weerasinghe, Xueren Ge, Tessa Heick, Lahiru Nuwan Wijayasingha, Anthony Cortez, Abhishek Satpathy, John Stankovic, Homa Alemzadeh

机构 * School of Engineering and Applied Science(工程与应用科学学院) School of Medicine(医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to AAAI 2026 (Preprint), 45 pages, 29 figures, updated references and figure orderings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12008 2025-11-18 cs.AI cs.CV cs.LG 81%

Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models

Yunqi Hong, Johnson Kao, Liam Edwards, Nein-Tzu Liu, Chung-Yen Huang, Alex Oliveira-Kowaleski, Cho-Jui Hsieh, Neil Y. C. Lin

机构 * Computer Science Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系) Mechanical and Aerospace Engineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校机械与航空航天工程系) Department of Pathology, Tri-Service General Hospital, National Defense Medical Center, Taipei, Taiwan(台湾国防医学院三军总医院病理部) Department of Pathology, National Taiwan University Hospital, Taipei, Taiwan(台湾国立台湾大学医院病理部) Department of Pathology, David Geffen School of Medicine, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校大卫·Geffen医学院病理部) Bioengineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校生物工程系) Institute for Quantitative and Computational Biosciences, University of California, CA, USA(加州大学定量与计算生物科学研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13530 2025-11-18 cs.RO cs.AI 79%

Towards Affect-Adaptive Human-Robot Interaction: A Protocol for Multimodal Dataset Collection on Social Anxiety

Vesna Poprcova, Iulia Lefter, Matthias Wieser, Martijn Warnier, Frances Brazier

机构 * Delft University of Technology(代尔夫特理工大学) Erasmus University Rotterdam(埃因霍温大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments Accepted at the Workshop on Benefits of pErsonalization and behAvioral adaptation in assistive Robots (BEAR 2025), held at the IEEE RO-MAN Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13351 2025-11-18 cs.LG cs.AI 79%

Dual-LoRA and Quality-Enhanced Pseudo Replay for Multimodal Continual Food Learning

Xinlan Wu, Bin Zhu, Feng Han, Pengkun Jiao, Jingjing Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University, China(复旦大学计算机科学与人工智能学院) Singapore Management University, Singapore(新加坡国立管理学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05966 2025-11-18 cs.CV 79%

Commonality in Few: Few-Shot Multimodal Anomaly Detection via Hypergraph-Enhanced Memory

Yuxuan Lin, Hanjing Yan, Xuan Tong, Yang Chang, Huanzhen Wang, Ziheng Zhou, Shuyong Gao, Yan Wang, Wenqiang Zhang

机构 * AAAI Press(AAAI 压力)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11623 2025-11-18 cs.LG cs.AI 79%

Early GVHD Prediction in Liver Transplantation via Multi-Modal Deep Learning on Imbalanced EHR Data

Yushan Jiang, Shuteng Niu, Dongjin Song, Yichen Wang, Jingna Feng, Xinyue Hu, Liu Yang, Cui Tao

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02650 2025-11-18 cs.CV 79%

Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models

Tianfan Peng, Yuntao Du, Pengzhou Ji, Shijie Dong, Kailin Jiang, Mingchuan Ma, Yijun Tian, Jinhe Bi, Qian Li, Wei Du, Feng Xiao, Lizhen Cui

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09649 2025-11-18 cs.CV 79%

The Brain Resection Multimodal Image Registration (ReMIND2Reg) 2025 Challenge

Reuben Dorent, Laura Rigolo, Colin P. Galvin, Junyu Chen, Mattias P. Heinrich, Aaron Carass, Olivier Colliot, Demian Wassermann, Alexandra Golby, Tina Kapur, William Wells

机构 * Inria Saclay Île-de-France(法国里昂萨克利研究所) CEA(法国原子能委员会) Université Paris-Saclay(巴黎-萨克利大学) Sorbonne Université(索邦大学) Institut du Cerveau - Paris Brain Institute - ICM(巴黎脑研究所) CNRS(法国国家科学研究中心) Inria(法国国家信息与自动化技术研究所) Inserm(法国国家医学研究院) AP-HP(法国国家医院集团) Hôpital de la Pitié Salpêtrière(皮蒂埃-萨尔普里埃尔医院) Harvard Medical School(哈佛医学院) Brigham and Women's Hospital(布里根医院) Department of Radiology and Radiological Science(放射学与放射科学系) Johns Hopkins Medical School(约翰霍普金斯医学院) Institute of Medical Informatics(医学信息学研究所) University of Lübeck(吕贝克大学) Image Analysis and Communications Laboratory(图像分析与通信实验室) Department of Electrical and Computer Engineering(电气与计算机工程系) Johns Hopkins University(约翰霍普金斯大学) CSAIL(媒体实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13707 2025-11-18 cs.RO 78%

OpenRoboCare: A Multimodal Multi-Task Expert Demonstration Dataset for Robot Caregiving

Xiaoyu Liang, Ziang Liu, Kelvin Lin, Edward Gu, Ruolin Ye, Tam Nguyen, Cynthia Hsu, Zhanxin Wu, Xiaoman Yang, Christy Sum Yu Cheung, Harold Soh, Katherine Dimitropoulou, Tapomayukh Bhattacharjee

专题命中 多模态评测 :multimodal(title,abstract)

Comments IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12436 2025-11-18 cs.RO 78%

RoboAfford++: A Generative AI-Enhanced Dataset for Multimodal Affordance Learning in Robotic Manipulation and Navigation

Xiaoshuai Hao, Yingbo Tang, Lingfeng Zhang, Yanbiao Ma, Yunfeng Diao, Ziyu Jia, Wenbo Ding, Hangjun Ye, Long Chen

机构 * Xiaomi EV(小米电动车) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)

专题命中 多模态评测 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12140 2025-11-18 cs.CL cs.CV 73%

Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding

Pinxue Guo, Chongruo Wu, Xinyu Zhou, Lingyi Hong, Zhaoyu Chen, Jinglun Li, Kaixun Jiang, Sen-ching Samson Cheung, Wei Zhang, Wenqiang Zhang

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13168 2025-11-18 cs.CV cs.AI 62%

SOMA: Feature Gradient Enhanced Affine-Flow Matching for SAR-Optical Registration

Haodong Wang, Tao Zhuo, Xiuwei Zhang, Hanlin Yin, Wencong Wu, Yanning Zhang

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16000 2025-11-18 cs.CL cs.AI 62%

Leveraging Online Data to Enhance Medical Knowledge in a Small Persian Language Model

Mehrdad Ghassabi, Pedram Rostami, Hamidreza Baradaran Kashani, Amirhossein Poursina, Zahra Kazemi, Milad Tavakoli

机构 * Faculty of Computer Engineering University of Isfahan(计算机工程系 岛岛大学) School of Medicine Isfahan University of Medical Sciences(医学院 岛岛医学科学大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11597 2025-11-18 cs.AI cs.CL 62%

CLINB: A Climate Intelligence Benchmark for Foundational Models

Michelle Chen Huebscher, Katharine Mach, Aleksandar Stanić, Markus Leippold, Ben Gaiarin, Zeke Hausfather, Elisa Rawat, Erich Fischer, Massimiliano Ciaramita, Joeri Rogelj, Christian Buck, Lierni Sestorain Saralegui, Reto Knutti

机构 * University of Miami(迈阿密大学) University of Zurich(苏黎世大学) Stripe(Stripe公司) ETH Zurich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Questions, system prompt and model judge prompts available here: https://www.kaggle.com/datasets/deepmind/clinb-questions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13626 2025-11-18 cs.AI 57%

CreBench: Human-Aligned Creativity Evaluation from Idea to Process to Product

Kaiwen Xue, Chenglong Li, Zhonghong Ou, Guoxin Zhang, Kaoyan Lu, Shuai Lyu, Yifan Zhu, Ping Zong Junpeng Ding, Xinyu Liu, Qunlin Chen, Weiwei Qin, Yiran Shen, Jiayi Cen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

Comments 13 pages, 3 figures,The 40th Annual AAAI Conference on Artificial Intelligence(AAAI 2026),Paper has been accepted for a poster presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13381 2025-11-18 cs.CL 57%

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts

Siyu Zhu, Mouxiao Bian, Yue Xie, Yongyu Tang, Zhikang Yu, Tianbin Li, Pengcheng Chen, Bing Han, Jie Xu, Xiaoyan Dong

机构 * Shanghai Children’s Hospital, School of Medicine,Shanghai Jiao Tong University(上海儿童医学中心,上海交通大学医学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University of Traditional Chinese Medicine(上海中医药大学) University of Washington(华盛顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12928 2025-11-18 cs.CL 57%

Visual Room 2.0: Seeing is Not Understanding for MLLMs

Haokun Li, Yazhou Zhang, Jizhi Ding, Qiuchi Li, Peng Zhang

机构 * Tianjin University(天津大学) Shandong Institute of Petroleum and Chemical Technology(山东石油化学技术学院) Beijing Institute of Technology(北京理工大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12648 2025-11-18 cs.CR cs.AI cs.LG 57%

Scalable Hierarchical AI-Blockchain Framework for Real-Time Anomaly Detection in Large-Scale Autonomous Vehicle Networks

Rathin Chandra Shit, Sharmila Subudhi

机构 * organization= Dept. of Computer Science \& Engg., International Institute of Information Technology , city= Bhubaneswar , postcode= 751003 , state= Odisha , country= India organization= Dept. of Computer Science, Maharaja Sriram Chandra Bhanja Deo University , city= Baripada , postcode= 757003 , state= Odisha , country= India

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

Comments Submitted to the Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02206 2025-11-18 cs.CV 57%

Language-Enhanced Generative Modeling for Amyloid PET Synthesis from MRI and Blood Biomarkers

Zhengjie Zhang, Xiaoxie Mao, Qihao Guo, Shaoting Zhang, Qi Huang, Mu Zhou, Fang Xie, Mianxin Liu

机构 * organization= Shanghai Artificial Intelligence Laboratory , city= Shanghai , postcode= 200082 , country= China organization= School of Medicine, Xiamen University , city= Xiamen , state= Fujian , country= China organization= Department of Nuclear Medicine \& PET Center, Huashan Hospital, Fudan University , city= Shanghai , country= China organization= Department of Gerontology, Shanghai Jiao Tong University Affiliated Sixth People’s Hospital , city= Shanghai , country= China organization= Department of Computer Science, Rutgers University , city= New Brunswick , state= New Jersey , country= United States organization= Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences , city= Shenzhen , country= China

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12026 2025-11-18 cs.CV 57%

Bridging Vision and Language for Robust Context-Aware Surgical Point Tracking: The VL-SurgPT Dataset and Benchmark

Rulin Zhou, Wenlong He, An Wang, Jianhang Zhang, Xuanhui Zeng, Xi Zhang, Chaowei Zhu, Haijun Hu, Hongliang Ren

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13343 2025-11-18 cs.AR 50%

Coliseum project: Correlating climate change data with the behavior of heritage materials

A Cormier, David Roqui, Fabrice Surma, Martin Labouré, Jean-Marc Vallet, Odile Guillon, N Grozavu, Ann Bourgès

专题命中 多模态评测 :multimodal(abstract)

Journal ref Stone 2025 : 15th International Congress on the Deterioration and Conservation of Stone, Sep 2025, Paris, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12990 2025-11-18 q-bio.QM 50%

Brain Networks Flow-Topology via Variance Minimization in the Wasserstein Space

Sixtus Dakurah

专题命中 多模态评测 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10213 2025-11-18 cs.LG 50%

Out-of-Context Misinformation Detection via Variational Domain-Invariant Learning with Test-Time Training

Xi Yang, Han Zhang, Zhijian Lin, Yibiao Hu, Hong Han

专题命中 多模态评测 :image-text(abstract)

Comments accepted by the AAAI Conference on Artificial Intelligence (AAAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00730 2025-11-18 cs.HC 50%

Teaching LLMs to See and Guide: Context-Aware Real-Time Assistance in Augmented Reality

Mahya Qorbani, Kamran Paynabar, Mohsen Moghaddam

专题命中 多模态评测 :multimodal(abstract)

Comments This work has been submitted to the IEEE Transactions on Systems, Man, and Cybernetics: Systems for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07083 2025-11-18 cs.NE 50%

A Generalized and Configurable Benchmark Generator for Continuous Unconstrained Numerical Optimization

Amir H. Gandomi, Mohammad Nabi Omidvar, Rohit Salgotra, Kalyanmoy Deb

专题命中 多模态评测 :multimodal(abstract)

Comments 14 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏