arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-14 至 2025-10-14 共收录 120 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 24 篇

2507.09279 2025-10-14 cs.CV cs.AI cs.CL 85%

Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confidence Calibration in Multimodal Large Language Models

Anita Kriz, Elizabeth Laura Janes, Xing Shen, Tal Arbel

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to ICCV 2025 Workshop CVAMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10464 2025-10-14 cs.CV 83%

Post-TIPS Prediction via Multimodal Interaction: A Multi-Center Dataset and Framework for Survival, Complication, and Portal Pressure Assessment

Junhao Dong, Dejia Liu, Ruiqi Ding, Zongxing Chen, Yingjie Huang, Zhu Meng, Jianbo Zhao, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Division of Vascular and Interventional Radiology, Department of General Surgery, Nanfang Hospital, Southern Medical University(南方医科大学普外科血管介入放射科) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 81 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24138 2025-10-14 cs.LG cs.AI 83%

AMSbench: A Comprehensive Benchmark for Evaluating MLLM Capabilities in AMS Circuits

Yichen Shi, Ze Zhang, Hongyang Wang, Zhuofu Tao, Zhongyi Li, Bingyu Chen, Yaxin Wang, Zhen huang, Xuhua Liu, Quan Chen, Zhiping Yu, Ting-Jung Lin, Lei He

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(美国加州大学洛杉矶分校) Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所)

专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09664 2025-10-14 cs.LG cs.CV cs.IR 83%

Semantic-Cohesive Knowledge Distillation for Deep Cross-modal Hashing

Changchang Sun, Vickie Chen, Yan Yan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Rensselaer Polytechnic Institute(拉特克利夫理工学院)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10965 2025-10-14 cs.CL cs.AI 81%

Judge Before Answer: Can MLLM Discern the False Premise in Question?

Jidong Li, Lingyong Fang, Haodong Zhao, Sufeng Duan, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10546 2025-10-14 cs.CV cs.AI 81%

GLOFNet -- A Multimodal Dataset for GLOF Monitoring and Prediction

Zuha Fatima, Muhammad Anser Sohaib, Muhammad Talha, Sidra Sultana, Ayesha Kanwal, Nazia Perwaiz

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11509 2025-10-14 cs.CV 79%

Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model

Ruiping Liu, Junwei Zheng, Yufan Chen, Zirui Wang, Kunyu Peng, Kailun Yang, Jiaming Zhang, Marc Pollefeys, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(title);MLLM(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track. Dataset and Code: https://github.com/RuipingL/Situat3DChange

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11645 2025-10-14 cs.AI 79%

Adapting and Evaluating Multimodal Large Language Models for Adolescent Idiopathic Scoliosis Self-Management: A Divide and Conquer Framework

Zhaolong Wu, Pu Luo, Nan Meng, Jason Pui Yin Cheung, Teng Zhang

机构 * Department of Orthopaedics and Traumatology, The University of Hong Kong(骨科与创伤外科部,香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments Accepted by MICCAI 2025 MLLMCP Workshop

Journal ref Lecture Notes in Computer Science 16147 (2026) 280-289

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10011 2025-10-14 cs.CV 79%

MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output

Yanyuan Chen, Dexuan Xu, Yu Huang, Songkun Zhan, Hanpin Wang, Dongxue Chen, Xueping Wang, Meikang Qiu, Hang Li

机构 * School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of Computer Science, Peking University(计算机学院,北京大学) National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Peking University Sixth Hospital(北京大学第六医院) Augusta University(奥古斯塔大学) Peking University First Hospital(北京大学第一医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08540 2025-10-14 cs.CV 79%

MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization

Xiangyu Zhao, Junming Lin, Tianhao Liang, Yifan Zhou, Wenhao Chai, Yuzhe Gu, Weiyun Wang, Kai Chen, Gen Luo, Wenwei Zhang, Junchi Yan, Hua Yang, Haodong Duan, Xue Yang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14028 2025-10-14 cs.CL 79%

MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application

Xueqing Peng, Lingfei Qian, Yan Wang, Ruoyu Xiang, Yueru He, Yang Ren, Mingyang Jiang, Vincent Jim Zhang, Yuqing Guo, Jeff Zhao, Huan He, Yi Han, Yun Feng, Yuechen Jiang, Yupeng Cao, Haohang Li, Yangyang Yu, Xiaoyu Wang, Penglei Gao, Shengyuan Lin, Keyi Wang, Shanshan Yang, Yilun Zhao, Zhiwei Liu, Peng Lu, Jerry Huang, Suyuchen Wang, Triantafillos Papadopoulos, Polydoros Giannouris, Efstathia Soufleri, Nuo Chen, Zhiyang Deng, Heming Fu, Yijia Zhao, Mingquan Lin, Meikang Qiu, Kaleb E Smith, Arman Cohan, Xiao-Yang Liu, Jimin Huang, Guojun Xiong, Alejandro Lopez-Lira, Xi Chen, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou, Qianqian Xie

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10765 2025-10-14 cs.CV 74%

EGD-YOLO: A Lightweight Multimodal Framework for Robust Drone-Bird Discrimination via Ghost-Enhanced YOLOv8n and EMA Attention under Adverse Condition

Sudipto Sarkar, Mohammad Asif Hasan, Khondokar Ashik Shahriar, Fablia Labiba, Nahian Tasnim, Sheikh Anawarul Haq Fattah

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10196 2025-10-14 cs.CV 70%

From Generic to Specialized: A Subspecialty Diagnostic System Powered by Self-Supervised Learning for Cervical Histopathology

Yizhi Wang, Li Chen, Qiang Huang, Tian Guan, Xi Deng, Zhiyuan Shen, Jiawen Li, Xinrui Chen, Bin Hu, Xitong Ling, Taojie Zhu, Zirui Huang, Deshui Yu, Yan Liu, Jiurun Chen, Lianghui Zhu, Qiming He, Yiqing Liu, Diwei Shi, Hanzhong Liu, Junbo Hu, Hongyi Gao, Zhen Song, Xilong Zhao, Chao He, Ming Zhao, Yonghong He

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04192 2025-10-14 cs.CV cs.AI cs.CL 67%

ViDRiP-LLaVA: A Dataset and Benchmark for Diagnostic Reasoning from Pathology Videos

Trinh T. L. Vuong, Jin Tae Kwak

机构 * Korea University(韩国大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11718 2025-10-14 cs.CV cs.AI 62%

CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images

Chengqi Duan, Kaiyue Sun, Rongyao Fang, Manyuan Zhang, Yan Feng, Ying Luo, Yufang Liu, Ke Wang, Peng Pei, Xunliang Cai, Hongsheng Li, Yi Ma, Xihui Liu

机构 * HKU(香港大学) Meituan(美团) CUHK(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21625 2025-10-14 cs.CL cs.AI cs.IR 62%

Doc2SAR: A Synergistic Framework for High-Fidelity Extraction of Structure-Activity Relationships from Scientific Documents

Jiaxi Zhuang, Kangning Li, Jue Hou, Mingjun Xu, Zhifeng Gao, Hengxing Cai

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11606 2025-10-14 cs.CV 57%

ExpVid: A Benchmark for Experiment Video Understanding & Reasoning

Yicheng Xu, Yue Wu, Jiashuo Yu, Ziang Yan, Tianxiang Jiang, Yinan He, Qingsong Zhao, Kai Chen, Yu Qiao, Limin Wang, Manabu Okumura, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Institute of Science Tokyo(东京科学研究所) Nanjing University(南京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments Data & Code: https://github.com/OpenGVLab/ExpVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00838 2025-10-14 cs.CV 57%

3MOS: Multi-sources, Multi-resolutions, and Multi-scenes dataset for Optical-SAR image matching

Yibin Ye, Xichao Teng, Shuo Chen, Yijie Bian, Tao Tan, Zhang Li

机构 * National University of Defense Technology(国防科技大学) Macao Polytechnic University(澳门理工学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

Comments 20pages 17 figures

Journal ref Visual Intelligence, 3(1), 1-27 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11389 2025-10-14 cs.CL 57%

Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies

Zirui Song, Yuan Huang, Junchang Liu, Haozhe Luo, Chenxi Wang, Lang Gao, Zixiang Xu, Mingfei Han, Xiaojun Chang, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

Comments 34 pages, 32figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09404 2025-10-14 cs.AI 57%

Agentic Systems in Radiology: Design, Applications, Evaluation, and Challenges

Christian Bluethgen, Dave Van Veen, Daniel Truhn, Jakob Nikolas Kather, Michael Moor, Malgorzata Polacin, Akshay Chaudhari, Thomas Frauenfelder, Curtis P. Langlotz, Michael Krauthammer, Farhad Nooralahzadeh

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10188 2025-10-14 cs.LG cs.CV 57%

INR-Bench: A Unified Benchmark for Implicit Neural Representations in Multi-Domain Regression and Reconstruction

Linfei Li, Fengyi Zhang, Zhong Wang, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Electrical Engineering and Computer Science, The University of Queensland(昆士兰大学电气工程与计算机科学学院) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09735 2025-10-14 cs.LG cs.AI 57%

InterCorpRel-LLM: Enhancing Financial Relational Understanding with Graph-Language Models

Qianyou Sun, Jiexin Zheng, Bohan Jin, Lihua Chen, Yijie Peng

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02587 2025-10-14 cs.CV cs.RO 57%

BEVCALIB: LiDAR-Camera Calibration via Geometry-Guided Bird's-Eye View Representations

Weiduo Yuan, Jerry Li, Justin Yue, Divyank Shah, Konstantinos Karydis, Hang Qiu

机构 * University of Southern California(南加州大学) University of California, Riverside(加州大学河滨分校)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

Journal ref 9th Conference on Robot Learning (CoRL 2025), Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17554 2025-10-14 cs.LG 50%

Bridging Graph and State-Space Modeling for Intensive Care Unit Length of Stay Prediction

Shuqi Zi, Haitz Sáez de Ocáriz Borde, Emma Rocheteau, Pietro Lio'

机构 * University of Cambridge, UK(剑桥大学) University of Oxford, UK(牛津大学)

专题命中 多模态评测 :multi-modal(abstract)

Comments Accepted at the GenAI for Health Workshop @ NeurIPS 2025. Code available at: https://github.com/ShuqiZi1/S2G-Net

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 8 篇

2510.10991 2025-10-14 cs.CV cs.AI cs.CL 85%

A Survey on Agentic Multimodal Large Language Models

Huanjin Yao, Ruifei Zhang, Jiaxing Huang, Jingyi Zhang, Yibo Wang, Bo Fang, Ruolin Zhu, Yongcheng Jing, Shunyu Liu, Guanbin Li, Dacheng Tao

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Shenzhen Research Institute of Big Data, China(大数据研究 institute) Sun Yat-sen University, China(中山大学) City University of Hong Kong, China(香港城市大学) Communication University of China, China(通信大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11498 2025-10-14 cs.LG cs.CL 83%

ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding

Yuhang Li, Chenchen Zhang, Ruilin Lv, Ao Liu, Ken Deng, Yuanxing Zhang, Jiaheng Liu, Wiggin Zhou, Bo Zhou

机构 * LLM Department, Tencent(腾讯大语言模型部门) Peking University(北京大学) Nanjing University(南京大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09762 2025-10-14 cs.LG cs.AI 79%

PatentVision: A multimodal method for drafting patent applications

Ruo Yang, Sai Krishna Reddy Mudhiganti, Manali Sharma

机构 * Samsung Semiconductor, Inc.(三星半导体公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01424 2025-10-14 cs.RO 67%

TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control

Zhenyang Liu, Yongchong Gu, Sixiao Zheng, Yanwei Fu, Xiangyang Xue, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11260 2025-10-14 cs.CV cond-mat.mtrl-sci cs.AI physics.data-an 62%

A Large-Language-Model Assisted Automated Scale Bar Detection and Extraction Framework for Scanning Electron Microscopic Images

Yuxuan Chen, Ruotong Yang, Zhengyang Zhang, Mehreen Ahmed, Yanming Wang

机构 * Shanghai Jiao Tong Global College(上海交通大学全球学院) Shanghai Jiao Tong University(上海交通大学) Global Institute of Future Technology(全球未来技术研究院) AI Lab, Xiaomi Corporation(小米公司AI实验室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11083 2025-10-14 cs.RO cs.AI 57%

Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling

Tianyi Tan, Yinan Zheng, Ruiming Liang, Zexu Wang, Kexin Zheng, Jinliang Zheng, Jianxiong Li, Xianyuan Zhan, Jingjing Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究所(AIR),清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

Comments 26 pages, 6 figures. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏