arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9205 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9205 篇

2508.07554 2025-08-12 cs.MM 70%

FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding

Xusheng He, Wei Liu, Shanshan Ma, Qian Liu, Chenghao Ma, Jianlong Wu

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14533 2025-08-12 cs.CV 70%

ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding

Shuo Cao, Nan Ma, Jiayang Li, Xiaohui Li, Lihao Shao, Kaiwen Zhu, Yu Zhou, Yuandong Pu, Jiarui Wu, Jiaquan Wang, Bo Qu, Wenhai Wang, Yu Qiao, Dajuin Yao, Yihao Liu

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments 43 pages, 31 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06565 2025-08-12 cs.CV cs.LG 70%

Bridging Brain Connectomes and Clinical Reports for Early Alzheimer's Disease Diagnosis

Jing Zhang, Xiaowei Yu, Minheng Chen, Lu Zhang, Tong Chen, Yan Zhuang, Chao Cao, Yanjun Lyu, Li Su, Tianming Liu, Dajiang Zhu

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03725 2025-08-07 cs.CV 70%

A Large Language Model Powered Integrated Circuit Footprint Geometry Understanding

Yida Wang, Taiting Lu, Runze Liu, Lanqing Yang, Yifan Yang, Zhe Chen, Yuehai Wang, Yixin Liu, Kaiyuan Lin, Xiaomeng Chen, Dian Ding, Yijie Li, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

机构 * Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Binghamton University(布ingham顿大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21619 2025-07-30 cs.CV 70%

EMIT: Enhancing MLLMs for Industrial Anomaly Detection via Difficulty-Aware GRPO

Wei Guan, Jun Lan, Jian Cao, Hao Tan, Huijia Zhu, Weiqiang Wang

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21157 2025-07-30 cs.CR cs.CV 70%

Unmasking Synthetic Realities in Generative AI: A Comprehensive Review of Adversarially Robust Deepfake Detection Systems

Naseem Khan, Tuan Nguyen, Amine Bermak, Issa Khalil

机构 * Department of Computer Science(计算机科学系) Hamad bin Khalifa University(哈马德·本·哈利法大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 27 pages, 4 Tables, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15140 2025-07-22 cs.AI 70%

Clinical Semantic Intelligence (CSI): Emulating the Cognitive Framework of the Expert Clinician for Comprehensive Oral Disease Diagnosis

Mohammad Mashayekhi, Sara Ahmadi Majd, Arian AmirAmjadi, Parsa Hosseini

机构 * Gilan University of Medical Sciences(加兹万大学医学科学学院) University of Göttingen(哥廷根大学) University of Tehran(德黑兰大学) Hamadan University of Technology(哈马丹技术大学) Islamic Azad University(伊斯兰 Azad 大学)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18023 2025-07-22 cs.CL 70%

DARE: Diverse Visual Question Answering with Robustness Evaluation

Hannah Sterz, Jonas Pfeiffer, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google DeepMind(谷歌DeepMind)

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01558 2025-07-21 cs.HC cs.AI 70%

Visual Grounding Methods for Efficient Interaction with Desktop Graphical User Interfaces

El Hassane Ettifouri, Jessica López Espejel, Laura Minkova, Tassnim Dardouri, Walid Dahhane

机构 * Research and Innovation Lab, Novelis(创新研究实验室,Novelis)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

Comments Preprint submitted to Engineering Applications of Artificial Intelligence journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12796 2025-07-18 cs.CV 70%

DeQA-Doc: Adapting DeQA-Score to Document Image Quality Assessment

Junjie Gao, Runze Liu, Yingzhe Peng, Shujian Yang, Jin Zhang, Kai Yang, Zhiyuan You

机构 * Ant Group(蚂蚁集团) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) CUHK(香港中文大学) MBZUAI(墨尔本大学人工智能研究所)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10432 2025-07-17 cs.CV 70%

Text-Visual Semantic Constrained AI-Generated Image Quality Assessment

Qiang Li, Qingsen Yan, Haojian Huang, Peng Wu, Haokui Zhang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments 9 pages, 5 figures, Accepted at ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01949 2025-07-03 cs.CV 70%

Kwai Keye-VL Technical Report

Kwai Keye Team, Biao Yang, Bin Wen, Changyi Liu, Chenglong Chu, Chengru Song, Chongling Rao, Chuan Yi, Da Li, Dunju Zang, Fan Yang, Guorui Zhou, Hao Peng, Haojie Ding, Jiaming Huang, Jiangxia Cao, Jiankang Chen, Jingyun Hua, Jin Ouyang, Kaibing Chen, Kaiyu Jiang, Kaiyu Tang, Kun Gai, Shengnan Zhang, Siyang Mao, Sui Huang, Tianke Zhang, Tingting Gao, Wei Chen, Wei Yuan, Xiangyu Wu, Xiao Hu, Xingyu Lu, Yang Zhou, Yi-Fan Zhang, Yiping Yang, Yulong Chen, Zhenhua Wu, Zhenyu Li, Zhixin Ling, Ziming Li, Dehua Ma, Di Xu, Haixuan Gao, Hang Li, Jiawei Guo, Jing Wang, Lejian Ren, Muhao Wei, Qianqian Wang, Qigen Hu, Shiyao Wang, Tao Yu, Xinchen Luo, Yan Li, Yiming Liang, Yuhang Hu, Zeyi Lu, Zhuoran Yang, Zixing Zhang

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

Comments Technical Report: https://github.com/Kwai-Keye/Keye

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10212 2025-06-13 cs.LG cs.AI eess.SP 70%

Cross-Learning Between ECG and PCG: Exploring Common and Exclusive Characteristics of Bimodal Electromechanical Cardiac Waveforms

Sajjad Karimi, Amit J. Shah, Gari D. Clifford, Reza Sameni

机构 * School of Medicine, Emory University(埃默里大学医学院) Rollins School of Public Health, Department of Epidemiology, Emory University(埃默里大学罗林斯公共卫生学院流行病学系) Department of Biomedical Engineering, Georgia Institute of Technology and Emory University(佐治亚理工学院生物医学工程系)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08933 2025-06-11 cs.CV 70%

What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities

Wendong Bu, Yang Wu, Qifan Yu, Minghe Gao, Bingchen Miao, Zhenkui Zhang, Kaihang Pan, Yunfei Li, Mengze Li, Wei Ji, Juncheng Li, Siliang Tang, Yueting Zhuang

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICML 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08553 2025-06-11 cs.CV 70%

From Pixels to Graphs: using Scene and Knowledge Graphs for HD-EPIC VQA Challenge

Agnese Taluzzi, Davide Gesualdi, Riccardo Santambrogio, Chiara Plizzari, Francesca Palermo, Simone Mentasti, Matteo Matteucci

机构 * Politecnico di Milano(米兰理工大学) EssilorLuxottica(Essilor Luxottica)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments Technical report for the HD-EPIC VQA Challenge 2025 (1st place)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05538 2025-06-09 cs.LG cs.MM 70%

SocialDF: Benchmark Dataset and Detection Model for Mitigating Harmful Deepfake Content on Social Media Platforms

Arnesh Batra, Anushk Kumar, Jashn Khemani, Arush Gumber, Arhan Jain, Somil Gupta

机构 * Indraprastha Institute of Information Technology(印度普拉斯塔信息技术学院)

专题命中 多模态评测 :multi-modal(abstract);audio-visual(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06126 2025-05-30 cs.CV 70%

X2-DFD: A framework for eXplainable and eXtendable Deepfake Detection

Yize Chen, Zhiyuan Yan, Guangliang Cheng, Kangran Zhao, Siwei Lyu, Baoyuan Wu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, Guangdong, 518172, P.R. China(1 数据科学学院,香港中文大学(深圳)) School of Electronic and Computer Engineering, Peking University, P.R. China(2 电子与计算机工程学院,北京大学) Department of Computer Science, University of Liverpool, Liverpool, L69 7ZX, UK(3 计算机科学系,利物浦大学) Department of Computer Science and Engineering, University at Buffalo, State University of New York, Buffalo, NY, USA(4 计算机科学与工程系,布法罗大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22427 2025-05-29 cs.CV 70%

RC-AutoCalib: An End-to-End Radar-Camera Automatic Calibration Network

Van-Tin Luu, Yon-Lin Cai, Vu-Hoang Tran, Wei-Chen Chiu, Yi-Ting Chen, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Ho Chi Minh City University of Technology and Education(胡志明市技术与教育大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21106 2025-05-28 cs.AI 70%

Interpreting Social Bias in LVLMs via Information Flow Analysis and Multi-Round Dialogue Evaluation

Zhengyang Ji, Yifan Jia, Shang Gao, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shandong University(山东大学) Institute of Deep Perception Technology, JITRI(深度感知技术研究所)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17761 2025-05-27 cs.CV 70%

OpenAD: Open-World Autonomous Driving Benchmark for 3D Object Detection

Zhongyu Xia, Jishuo Li, Zhiwei Lin, Xinhao Wang, Yongtao Wang, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) University of California, Merced(加州大学梅尔德分校)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16151 2025-05-23 cs.CV 70%

Training-Free Reasoning and Reflection in MLLMs

Hongchen Wei, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(遥感与信息工程学院,武汉大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14197 2025-05-21 cs.CV 70%

Towards Omnidirectional Reasoning with 360-R1: A Dataset, Benchmark, and GRPO-based Method

Xinshen Zhang, Zhen Ye, Xu Zheng

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州))

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11852 2025-05-20 cs.CV 70%

MedSG-Bench: A Benchmark for Medical Image Sequences Grounding

Jingkun Yue, Siqi Zhang, Zinan Jia, Huihuan Xu, Zongbo Han, Xiaohong Liu, Guangyu Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) South China Hospital, Medical School, Shenzhen University(深圳大学医学院南方医院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05240 2025-05-09 cs.CV 70%

PADriver: Towards Personalized Autonomous Driving

Genghua Kou, Fan Jia, Weixin Mao, Yingfei Liu, Yucheng Zhao, Ziheng Zhang, Osamu Yoshie, Tiancai Wang, Ying Li, Xiangyu Zhang

机构 * Beijing Institute of Technology(北京理工大学) Megvii Technology(商汤科技) Waseda University(早稻田大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01711 2025-05-06 cs.CV 70%

Knowledge-Augmented Language Models Interpreting Structured Chest X-Ray Findings

Alexander Davis, Rafael Souza, Jia-Hao Lim

机构 * University of Brasilia(巴西大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13995 2025-04-22 cs.CV 70%

Scaling LLaNA: Advancing NeRF-Language Understanding Through Large-Scale Training

Andrea Amaduzzi, Pierluigi Zama Ramirez, Giuseppe Lisanti, Samuele Salti, Luigi Di Stefano

机构 * CVLAB, University of Bologna(CV实验室,博洛尼亚大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Under submission. Project page at https://andreamaduzzi.github.io/llana/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17347 2025-04-22 cs.CV 70%

Language-guided Scale-aware MedSegmentor for Lesion Segmentation in Medical Imaging

Shuyi Ouyang, Jinyang Zhang, Xiangye Lin, Xilai Wang, Qingqing Chen, Yen-Wei Chen, Lanfen Lin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Radiology, Sir Run Run Shaw Hospital(邵逸夫医院放射科) College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11218 2025-04-17 cs.CV 70%

3DAffordSplat: Efficient Affordance Reasoning with 3D Gaussians

Zeming Wei, Junyi Lin, Yang Liu, Weixing Chen, Jingzhou Luo, Guanbin Li, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments The first large-scale 3D Gaussians Affordance Reasoning Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09764 2025-04-15 cs.CV 70%

Socratic Chart: Cooperating Multiple Agents for Robust SVG Chart Understanding

Yuyang Ji, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09402 2025-04-08 cs.CV 70%

MultiEYE: Dataset and Benchmark for OCT-Enhanced Retinal Disease Recognition from Fundus Images

Lehan Wang, Chongchong Qi, Chubin Ou, Lin An, Mei Jin, Xiangbin Kong, Xiaomeng Li

机构 * Hong Kong University of Science and Technology(香港科技大学) Guangdong Weiren Meditech Co., Ltd.(广东伟仁医疗科技有限公司) Yunnan United Vision Innovations Technology Co., Ltd.(云南联合视力创新科技有限公司) Guangdong Hospital of Integrated Traditional Chinese and Western Medicine(广东省中西医结合医院) Second People’s Hospital of Foshan(佛山市第二人民医院)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted at IEEE TMI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏