arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9213 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9213 篇

2509.02175 2025-09-05 cs.CV cs.AI cs.CL cs.LG 67%

Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks

Nils Hoehing, Mayug Maniparambil, Ellen Rushe, Noel E. O'Connor, Anthony Ventresque

机构 * School of Computer Science(计算机科学学院) University College Dublin(都柏林大学) School of Computing(计算机科学学院) Dublin City University(都柏林城市大学) School of Electronic Engineering(电子工程学院) Trinity College Dublin(都柏林三一学院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18088 2025-08-28 cs.RO cs.AI cs.CL cs.CV cs.MA 67%

RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation

Tianxing Chen, Zanxin Chen, Baijun Chen, Zijian Cai, Yibin Liu, Zixuan Li, Qiwei Liang, Xianliang Lin, Yiheng Ge, Zhenyu Gu, Weiliang Deng, Yubin Guo, Tian Nian, Xuanbing Xie, Qiangyu Chen, Kailun Su, Tianling Xu, Guodong Liu, Mengkang Hu, Huan-ang Gao, Kaixuan Wang, Zhixuan Liang, Yusen Qin, Xiaokang Yang, Ping Luo, Yao Mu

机构 * MoE key Lab of Artificial Intelligence, AI Institute, SJTU(人工智能联合实验室、人工智能研究院、上海交通大学) HKU MMLab(香港大学多模态实验室) Shanghai AI Lab(上海人工智能实验室) D-Robotics(D-机器人) SZU(深圳大学) THU(清华大学) TeleAI FDU(福建大学) USTC(中国科学技术大学) SUSTech(南方科技大学) SYSU(深圳大学) CSU(中国科学技术大学) NEU(南京大学) HKU-SH ICRC(香港大学深圳研究院) NJU(南京大学) Lumina EAI

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Project Page: https://robotwin-platform.github.io/, Code: https://github.com/robotwin-Platform/robotwin, Doc: https://robotwin-platform.github.io/doc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14080 2025-08-21 cs.LG 67%

KnowDR-REC: A Benchmark for Referring Expression Comprehension with Real-World Knowledge

Guanghao Jin, Jingpei Wu, Tianpei Guo, Yiyi Niu, Weidong Zhou, Guoyang Liu

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07022 2025-08-12 cs.AI cs.CL cs.LG cs.MM 67%

MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA

Shengtao Wen, Haodong Chen, Yadong Wang, Zhongying Pan, Xiang Chen, Yu Tian, Bo Qian, Dong Liang, Sheng-Jun Huang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05669 2025-08-11 cs.IR cs.AI cs.CL cs.CV cs.LG 67%

Fine-Tuning Vision-Language Models for Markdown Conversion of Financial Tables in Malaysian Audited Financial Reports

Jin Khye Tan, En Jun Choong, Ethan Jeremiah Chitty, Yan Pheng Choo, John Hsin Yang Wong, Chern Eu Cheah

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 28 pages, 14 figures, 5 tables. Evaluation code (LLM-as-a-judge and Markdown TEDS) is available at https://github.com/jinkhye/MyFinMarkdown. The development dataset and evaluation benchmark are available on Hugging Face at https://huggingface.co/datasets/jinkhye/MyFinMarkdown-sample and https://huggingface.co/datasets/jinkhye/MyFinMarkdown-bench respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09105 2025-08-11 cs.CV cs.AI cs.CL cs.LG 67%

INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance

Chenwei Lin, Hanjia Lyu, Xian Xu, Jiebo Luo

机构 * School of Computer Science Fudan University(复旦大学计算机科学学院) Department of Computer Science University of Rochester(罗切斯特大学计算机科学系) School of Economics Fudan University(复旦大学经济学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments To appear in the International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03560 2025-08-06 cs.SE 67%

LaTCoder: Converting Webpage Design to Code with Layout-as-Thought

Yi Gui, Zhen Li, Zhongyi Zhang, Guohao Wang, Tianpeng Lv, Gaoyang Jiang, Yi Liu, Dongping Chen, Yao Wan, Hongyu Zhang, Wenbin Jiang, Xuanhua Shi, Hai Jin

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

Comments KDD 2025 v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22099 2025-07-31 cs.CV cs.AI cs.MM cs.SE 67%

Runtime Failure Hunting for Physics Engine Based Software Systems: How Far Can We Go?

Shuqing Li, Qiang Chen, Xiaoxue Ren, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16877 2025-07-24 cs.CV cs.AI cs.CL 67%

ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension

Yizhi Hu, Zezhao Tian, Xingqun Qi, Chen Su, Bingkun Yang, Junhui Yin, Muyi Sun, Man Zhang, Zhenan Sun

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01534 2025-07-24 cs.CV cs.AI cs.MM 67%

Cross-domain Multi-step Thinking: Zero-shot Fine-grained Traffic Sign Recognition in the Wild

Yaozong Gan, Guang Li, Ren Togo, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生学校,北海道大学) Education and Research Center for Mathematical and Data Science, Hokkaido University(数学与数据科学教育与研究中心,北海道大学) Faculty of Information Science and Technology, Hokkaido University(信息科学与技术学院,北海道大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Published by Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11798 2025-07-22 cs.CR 67%

BackdoorDM: A Comprehensive Benchmark for Backdoor Learning on Diffusion Model

Weilin Lin, Nanjun Zhou, Yanyun Wang, Jianze Li, Hui Xiong, Li Liu

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12490 2025-07-18 cs.CV cs.AI cs.CL cs.LG 67%

Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering

Maximiliano Hormazábal Lagos, Héctor Cerezo-Costas, Dimosthenis Karatzas

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(计算机视觉中心,巴塞罗那自治大学) Gradiant

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments This work has been accepted for presentation at the 16th Conference and Labs of the Evaluation Forum (CLEF 2025) and will be published in the proceedings by Springer in the Lecture Notes in Computer Science (LNCS) series. Please cite the published version when available

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08306 2025-07-14 cs.AI cs.CL cs.CV cs.LG 67%

M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning

Inclusion AI, :, Fudong Wang, Jiajia Liu, Jingdong Chen, Jun Zhou, Kaixiang Ji, Lixiang Ru, Qingpei Guo, Ruobing Zheng, Tianqi Li, Yi Yuan, Yifan Mao, Yuting Xiao, Ziping Ma

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 31pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14419 2025-07-01 cs.AI cs.CL cs.CV 67%

CHARTOM: A Visual Theory-of-Mind Benchmark for LLMs on Misleading Charts

Shubham Bharti, Shiyun Cheng, Jihyun Rho, Jianrui Zhang, Mu Cai, Yong Jae Lee, Martina Rau, Xiaojin Zhu

机构 * UW Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11604 2025-06-30 cs.AI cs.CL cs.CV 67%

VLM@school -- Evaluation of AI image understanding on German middle school knowledge

René Peinl, Vincent Tischler

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Peinl, René; Tischler, Vincent (2025): VLM@school - Evaluation of AI image understanding on German middle school knowledge. Future Technologies Conference (FTC) 2025, Munich, Germany 2025 (accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05384 2025-06-13 cs.CV cs.AI cs.MM 67%

Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment

Zhuoxuan Cai, Jian Zhang, Xinbin Yuan, Peng-Tao Jiang, Wenxiang Chen, Bowen Tang, Lujian Yao, Qiyuan Wang, Jinwen Chen, Bo Li

机构 * Fudan University(复旦大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19267 2025-06-11 cs.CL cs.AI cs.CV cs.LG 67%

VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?

Mohamed Gado, Towhid Taliee, Muhammad Memon, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg, Germany(计算机视觉实验室,CAIDAS,乌尔姆大学,德国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18362 2025-06-09 cs.AI cs.CL cs.CV cs.LG 67%

MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding

Yuxin Zuo, Shang Qu, Yifei Li, Zhangren Chen, Xuekai Zhu, Ermo Hua, Kaiyan Zhang, Ning Ding, Bowen Zhou

机构 * Tsinghua University, Beijing, China(清华大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04353 2025-06-06 cs.CV cs.AI cs.CE cs.CL cs.LG 67%

ReXVQA: A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding

Ankit Pal, Jung-Oh Lee, Xiaoman Zhang, Malaikannan Sankarasubbu, Seunghyeon Roh, Won Jung Kim, Meesun Lee, Pranav Rajpurkar

机构 * Saama AI Research(Saama AI研究机构) Seoul National University(首尔国立大学) Harvard Medical School(哈佛医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11556 2025-06-03 cs.CV cs.AI cs.CL 67%

StarVector: Generating Scalable Vector Graphics Code from Images and Text

Juan A. Rodriguez, Abhay Puri, Shubham Agarwal, Issam H. Laradji, Pau Rodriguez, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08279 2025-05-27 cs.CL cs.AI cs.CV 67%

What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations

Dongqi Liu, Chenxi Whitehouse, Xi Yu, Louis Mahon, Rohit Saxena, Zheng Zhao, Yifu Qiu, Mirella Lapata, Vera Demberg

机构 * Saarland University(萨尔兰大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACL 2025 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18413 2025-05-27 cs.LG cs.AI cs.CL cs.CV 67%

LatentLLM: Attention-Aware Joint Tensor Compression

Toshiaki Koike-Akino, Xiangyu Chen, Jing Liu, Ye Wang, Pu, Wang, Matthew Brand

机构 * Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 37 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16256 2025-05-23 cs.CV cs.AI cs.MM 67%

DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor

Yan Zhao, Zhengxue Cheng, Junxuan Zhang, Qunshan Gu, Qi Wang, Li Song

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学) Ant Group(蚂蚁集团)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments 18 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12030 2025-05-22 cs.CV cs.AI cs.CL 67%

SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model

Yongting Zhang, Lu Chen, Guodong Zheng, Yifeng Gao, Rui Zheng, Jinlan Fu, Zhenfei Yin, Senjie Jin, Yu Qiao, Xuanjing Huang, Feng Zhao, Tao Gui, Jing Shao

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13115 2025-05-20 cs.CL cs.AI cs.LG cs.SD eess.AS 67%

Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning

Debarpan Bhattacharya, Apoorva Kulkarni, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted in INTERSPEECH, 2025, Rotterdam, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12194 2025-05-20 cs.RO 67%

Spatial-LLaVA: Enhancing Large Language Models with Spatial Referring Expressions for Visual Understanding

Xuefei Sun, Doncey Albin, Cecilia Mauceri, Dusty Woods, Christoffer Heckman

机构 * Autonomous Robotics and Perception Group in the Computer Science Department at the University of Colorado Boulder(科罗拉多大学波德分校计算机科学系自主机器人与感知小组)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21435 2025-05-14 cs.CV cs.AI cs.CL 67%

SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding

Chenkai Zhang, Yiming Lei, Zeming Liu, Haitao Leng, Shaoguo Liu, Tingting Gao, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Hangzhou Innovation Institute, Beihang University(杭州创新研究院) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 29 pages, 15 figures, CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10380 2025-04-02 cs.CV cs.AI cs.CL cs.IR 67%

NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models

Pranshu Pandya, Vatsal Gupta, Agney S Talwarr, Tushar Kataria, Dan Roth, Vivek Gupta

机构 * IIT Guwahati(印度古瓦哈蒂印度理工学院) University of Utah(犹他大学) University of Pennsylvania(宾夕法尼亚大学) Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 28 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14895 2025-03-20 cs.CV cs.AI cs.CL 67%

Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations

Shuo Li, Jiajun Sun, Guodong Zheng, Xiaoran Fan, Yujiong Shen, Yi Lu, Zhiheng Xi, Yuming Yang, Wenming Tan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01863 2025-03-05 cs.CV cs.AI cs.CL cs.CY eess.IV 67%

Vision Language Models in Medicine

Beria Chingnabe Kalpelbe, Angel Gabriel Adaambiik, Wei Peng

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏