arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-07 至 2025-08-07 共收录 25 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 25 篇

2508.04625 2025-08-07 cs.CV cs.CE 83%

FinMMR: Make Financial Numerical Reasoning More Multimodal, Comprehensive, and Challenging

Zichen Tang, Haihong E, Jiacheng Liu, Zhongjun Yang, Rongjin Li, Zihua Rong, Haoyang He, Zhuodi Hao, Xinyang Hu, Kun Ji, Ziyan Ma, Mengyuan Ji, Jun Zhang, Chenghao Ma, Qianhe Zheng, Yang Liu, Yiling Huang, Xinyi Hu, Qing Huang, Zijian Xie, Shiyao Peng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICCV 2025. arXiv admin note: text overlap with arXiv:2311.06602 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04576 2025-08-07 cs.AI 83%

ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges

Yue Zhou, Yi Chang, Yuan Wu

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13053 2025-08-07 cs.CL 83%

Evaluating the Robustness of Multimodal Agents Against Active Environmental Injection Attacks

Yurun Chen, Xavier Hu, Keting Yin, Juncheng Li, Shengyu Zhang

机构 * School of Software Technology Zhejiang University Hangzhou Zhejiang China(软件技术学院浙江大学杭州浙江中国) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

Comments Accepted at ACM MM 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04350 2025-08-07 cs.CL cs.AI cs.CV cs.LG cs.MA 82%

Chain of Questions: Guiding Multimodal Curiosity in Language Models

Nima Iji, Kia Dashtipour

机构 * Edinburgh Napier University(爱丁堡纳皮尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04206 2025-08-07 cs.IR 82%

ViLLA-MMBench: A Unified Benchmark Suite for LLM-Augmented Multimodal Movie Recommendation

Fatemeh Nazary, Ali Tourani, Yashar Deldjoo, Tommaso Di Noia

专题命中 多模态评测 :multimodal(title,abstract);audio-visual(abstract)

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03733 2025-08-07 cs.LG cs.AI cs.CL cs.CV 82%

CX-Mind: A Pioneering Multimodal Large Language Model for Interleaved Reasoning in Chest X-ray via Curriculum-Guided Reinforcement Learning

Wenjie Li, Yujie Zhang, Haoran Sun, Yueqi Li, Fanrui Zhang, Mengzhe Xu, Victoria Borja Clausich, Sade Mellin, Renhao Yang, Chenrun Wang, Jethro Zih-Shuo Wang, Shiyi Yao, Gen Li, Yidong Xu, Hanyu Wang, Yilin Huang, Angela Lin Wang, Chen Shi, Yin Zhang, Jianan Guo, Luqi Yang, Renxuan Li, Yang Xu, Jiawei Liu, Yao Zhang, Lei Liu, Carlos Gutiérrez SanRomán, Lei Wang

机构 * College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院健康科学与技术学院) Shanghai Innovation Institute(上海创新研究院) Clinical Center for Sports Medicine, Department of Orthopaedics, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院骨科临床中心) School of Basic Medical Sciences, Intelligent Medicine Institute, Fudan University(复旦大学基础医学学院) Department of Hematology, The First Affiliated Hospital, College of Medicine, Zhejiang University(浙江大学医学院第一附属医院血液科) MoE Key Laboratory of Brain-Inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发智能感知与认知教育部重点实验室) Department of Public Health and Primary Care, University of Cambridge(剑桥大学公共卫生与初级保健学院) Department of Medicine, Faculty of Health Sciences, Universidad CEU Cardenal Herrera(CEU卡德纳尔-赫尔曼大学健康科学学院医学系) Faculty of Medicine, University of Helsinki(赫尔辛基大学医学院) X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院X-LANCE实验室) Department of Hepatobiliary Surgery, National Cancer Center / National Clinical Research Center for Cancer / Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院肿瘤医院肝胆外科) Department of Surgery, The Ohio State University Wexner Medical Center, The James Comprehensive Cancer Center(俄亥俄州立大学韦克斯纳医学中心外科部,詹姆斯综合癌症中心) Ningbo Institute of Technology, Beihang University(北航宁波理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02745 2025-08-07 cs.CV cs.AI cs.CL 82%

AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity

Zhibin Lan, Liqiang Niu, Fandong Meng, Wenbo Li, Jie Zhou, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12772 2025-08-07 cs.CV cs.AI cs.RO 81%

NuPlanQA: A Large-Scale Dataset and Benchmark for Multi-View Driving Scene Understanding in Multi-Modal Large Language Models

Sung-Yeon Park, Can Cui, Yunsheng Ma, Ahmadreza Moradipari, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04192 2025-08-07 cs.CV 79%

From Learning to Unlearning: Biomedical Security Protection in Multimodal Large Language Models

Dunyuan Xu, Xikai Yang, Yaoqian Li, Jinpeng Li, Pheng-Ann Heng

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04059 2025-08-07 cs.CV 79%

Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models

Zhaochen Liu, Kaiwen Gao, Shuyi Liang, Bin Xiao, Limeng Qiao, Lin Ma, Tingting Jiang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04017 2025-08-07 cs.CV 79%

Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability

Haiqi Yang, Jinzhe Li, Gengxu Li, Yi Chang, Yuan Wu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 9pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04240 2025-08-07 eess.SP 78%

ChineseEEG-2: An EEG Dataset for Multimodal Semantic Alignment and Neural Decoding during Reading and Listening

Sitong Chen, Beiqianyi Li, Cuilin He, Dongyang Li, Mingyang Wu, Xinke Shen, Song Wang, Xuetao Wei, Xindi Wang, Haiyan Wu, Quanying Liu

专题命中 多模态评测 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03958 2025-08-07 cs.IR cs.AI cs.CL cs.LG 73%

A Comparative Study of Specialized LLMs as Dense Retrievers

Hengran Zhang, Keping Bi, Jiafeng Guo

机构 * Key Laboratory of Network Data Science and Technology(网络数据科学与技术重点实验室) Institute of Computing Technology(计算技术研究所) Chinese Academy of Sciences(中国科学院) State Key Laboratory of AI Safety(人工智能安全国家重点实验室) University of Chinese Academy of Science(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted by CCIR25 and published by Springer LNCS or LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03725 2025-08-07 cs.CV 70%

A Large Language Model Powered Integrated Circuit Footprint Geometry Understanding

Yida Wang, Taiting Lu, Runze Liu, Lanqing Yang, Yifan Yang, Zhe Chen, Yuehai Wang, Yixin Liu, Kaiyuan Lin, Xiaomeng Chen, Dian Ding, Yijie Li, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

机构 * Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Binghamton University(布ingham顿大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10018 2025-08-07 cs.CV cs.AI 66%

RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework

Xiao Wang, Haiyang Wang, Shiao Wang, Qiang Chen, Jiandong Jin, Haoyu Song, Bo Jiang, Chenglong Li

机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学) School of Artificial Intelligence, Anhui University(人工智能学院,安徽大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI;multimodal(comments)

Comments The First Benchmark Dataset for RGB-Event Multimodal Pedestrian Attribute Recognition Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04567 2025-08-07 cs.CV cs.CL 62%

Analyzing and Mitigating Object Hallucination: A Training Bias Perspective

Yifan Li, Kun Zhou, Wayne Xin Zhao, Lei Fang, Ji-Rong Wen

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04531 2025-08-07 cs.CL cs.AI 62%

Unveiling the Landscape of Clinical Depression Assessment: From Behavioral Signatures to Psychiatric Reasoning

Zhuang Chen, Guanqun Bi, Wen Zhang, Jiawei Hu, Aoyun Wang, Xiyao Xiao, Kun Feng, Minlie Huang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) CoAI Group, DCST, IAI, BNRIST, Tsinghua University(清华大学) University of International Relations(国际关系大学) Central China Normal University(华中师范大学) Lingxin AI(灵心AI) Yuquan Hospital, Tsinghua University(清华大学友谊医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17125 2025-08-07 cs.CV cs.AI 62%

DOGR: Towards Versatile Visual Document Grounding and Referring

Yinan Zhou, Yuxin Chen, Haokun Lin, Yichen Wu, Shuyu Yang, Zhongang Qi, Chen Ma, Li Zhu, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) City University of Hongkong(香港城市大学) Institute of Automation, CAS(中国科学院自动化研究所) Harvard University(哈佛大学) vivo Mobile Communication Co.(vivo移动通信公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 22 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04681 2025-08-07 cs.CV 57%

Perceiving and Acting in First-Person: A Dataset and Benchmark for Egocentric Human-Object-Human Interactions

Liang Xu, Chengqun Yang, Zili Lin, Fei Xu, Yifan Liu, Congsheng Xu, Yiyi Zhang, Jie Qin, Xingdong Sheng, Yunhui Liu, Xin Jin, Yichao Yan, Wenjun Zeng, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能教育部重点实验室,上海交通大学AI研究院) Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) MoE Key Lab of AI, School of Computer Science, Shanghai Jiao Tong University(人工智能教育部重点实验室,上海交通大学计算机学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Lenovo(联想公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. Project Page: https://liangxuy.github.io/InterVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04642 2025-08-07 cs.RO cs.CV 57%

RoboTron-Sim: Improving Real-World Driving via Simulated Hard-Case

Baihui Xiao, Chengjian Feng, Zhijian Huang, Feng yan, Yujie Zhong, Lin Ma

机构 * Meituan(美团) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04043 2025-08-07 cs.CV 57%

VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning

Yuheng Ji, Yipu Wang, Yuyang Liu, Xiaoshuai Hao, Yue Liu, Yuting Zhao, Huaihai Lyu, Xiaolong Zheng

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04041 2025-08-07 cs.CV 57%

SPJFNet: Self-Mining Prior-Guided Joint Frequency Enhancement for Ultra-Efficient Dark Image Restoration

Tongshun Zhang, Pingling Liu, Zijian Zhang, Qiuzhan Zhou

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03732 2025-08-07 cs.CV 57%

What is Beneath Misogyny: Misogynous Memes Classification and Explanation

Kushal Kanwar, Dushyant Singh Chauhan, Gopendra Vikram Singh, Asif Ekbal

机构 * Jaypee University of Information Technology(杰伊佩大学信息科技学院) CortexTor Labs(CortexTor实验室) Amity Center for Artificial Intelligence(阿米蒂人工智能中心) Indian Institute of Technology Jodhpur(印度理工学院朱道尔)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06798 2025-08-07 cs.CV 57%

Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding

Ke Zou, Yang Bai, Bo Liu, Yidi Chen, Zhihao Chen, Yang Zhou, Xuedong Yuan, Meng Wang, Xiaojing Shen, Xiaochun Cao, Yih Chung Tham, Huazhu Fu

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Radiology, West China Hospital, Sichuan University(四川大学华西医院放射科) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Department of Mathematics, Sichuan University(四川大学数学系) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院) Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore and the Singapore Eye Research Institute, Singapore National Eye Centre(新加坡国立大学 Yong Loo Lin 医学院眼科系及新加坡眼科研所、新加坡国家眼科中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04694 2025-08-07 cs.SI cs.SY eess.SY 50%

Layers of a City: Network-Based Insights into San Diego's Transportation Ecosystem

Matthew Chan, Steve Sharp, Jiajian Zhu, Raman Ebrahimi

专题命中 多模态评测 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏