arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2502.10973 2025-06-04 cs.CL 79%

Akan Cinematic Emotions (ACE): A Multimodal Multi-party Dataset for Emotion Recognition in Movie Dialogues

David Sasu, Zehui Wu, Ziwei Gong, Run Chen, Pengyuan Shi, Lin Ai, Julia Hirschberg, Natalie Schluter

机构 * IT University of Copenhagen(丹麦技术大学) Columbia University(哥伦比亚大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to Findings at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01520 2025-06-03 cs.CL 79%

FormFactory: An Interactive Benchmarking Suite for Multimodal Form-Filling Agents

Bobo Li, Yuheng Wang, Hao Fei, Juncheng Li, Wei Ji, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01891 2025-06-03 cs.LG cs.CL 79%

MMSciBench: Benchmarking Language Models on Chinese Multimodal Scientific Problems

Xinwu Ye, Chengfan Li, Siming Chen, Wei Wei, Xiangru Tang

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) Department of Computer Science, Brown University(布朗大学计算机科学系) School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Key Laboratory of Data Science(上海数据科学关键实验室) Datawiz LLC

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to the Findings of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00488 2025-06-03 cs.CL 79%

Synergizing LLMs with Global Label Propagation for Multimodal Fake News Detection

Shuguo Hu, Jun Hu, Huaiwen Zhang

机构 * Inner Mongolia University(内蒙古大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00107 2025-06-03 cs.IR cs.AI 79%

Gated Multimodal Graph Learning for Personalized Recommendation

Sibei Liu, Yuanzhe Zhang, Xiang Li, Yunbo Liu, Chengwei Feng, Hao Yang

机构 * Miami Herbert Business School, University of Miami, FL, United States(迈阿密赫伯特商学院,迈阿密大学,佛罗里达州,美国) School of Engineering, University of California, California, US(加州大学工程学院,加州,美国) Department of Electrical & Computer Engineering, Rutgers University, Sunnyvale, United States(新泽西理工学院电子与计算机工程系,索菲亚维尔,美国) Department of Electrical and Computer Engineering, Duke University, NC, United States(杜克大学电子与计算机工程系,北卡罗来纳州,美国) School of Engineering, Computer & Mathematical Sciences (ECMS), Auckland University of Technology, Auckland, New Zealand(奥克兰理工大学工程学院,计算机与数学科学(ECMS)系,奥克兰,新西兰) Department Of Computer Science, Universiti Putra Malaysia, Kuala Lumpur, Malaysia(马来西亚国立大学计算机科学系,吉隆坡,马来西亚)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00009 2025-06-03 q-bio.BM cs.AI 79%

MolTextNet: A Two-Million Molecule-Text Dataset for Multimodal Molecular Learning

Yihan Zhu, Gang Liu, Eric Inae, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments 21 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24714 2025-06-02 cs.CL 79%

FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation

Junyu Luo, Zhizhuo Kou, Liming Yang, Xiao Luo, Jinsheng Huang, Zhiping Xiao, Jingshu Peng, Chengzhong Liu, Jiaming Ji, Xuanzhe Liu, Sirui Han, Ming Zhang, Yike Guo

机构 * State Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab(多媒体信息处理国家重点实验室,PKU-Anker LLM实验室) School of Computer Science, Peking University(北京大学计算机学院) HKUST(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CL

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24458 2025-06-02 cs.AI 79%

SEAR: A Multimodal Dataset for Analyzing AR-LLM-Driven Social Engineering Behaviors

Tianlong Yu, Chenghang Ye, Zheyu Yang, Ziyi Zhou, Cui Tang, Zui Tao, Jun Zhang, Kailong Wang, Liting Zhou, Yang Yang, Ting Bi

机构 * Huazhong University of Science and Technology(华中科技大学) Hubei University(湖北大学) Dublin City University(都柏林城市大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24423 2025-06-02 cs.CL 79%

MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs

Zhiwei Liu, Lingfei Qian, Qianqian Xie, Jimin Huang, Kailai Yang, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) The Fin AI Singapore(Fin AI新加坡) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15072 2025-06-02 cs.LG cs.CL cs.DB cs.IR 79%

MoTime: A Dataset Suite for Multimodal Time Series Forecasting

Xin Zhou, Weiqing Wang, Francisco J. Baldán, Wray Buntine, Christoph Bergmeir

机构 * Monash University(墨尔本大学) University of Málaga(马拉加大学) VinUniversity(文大学) University of Granada(格拉纳达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11357 2025-06-02 cs.AI cs.HC 79%

Explorer: Scaling Exploration-driven Web Trajectory Synthesis for Multimodal Web Agents

Vardaan Pahuja, Yadong Lu, Corby Rosset, Boyu Gou, Arindam Mitra, Spencer Whitehead, Yu Su, Ahmed Awadallah

机构 * The Ohio State University(俄亥俄州立大学) Microsoft Research(微软研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23242 2025-05-30 cs.CL 79%

ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering

Jingxuan Wei, Nan Xu, Junnan Zhu, Yanni Hao, Gaowei Wu, Bihui Yu, Lei Wang

机构 * Beijing Wenge Technology Co., Ltd.(北京文格科技有限公司) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16555 2025-05-30 cs.CL 79%

Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models

Yanxu Mao, Peipei Liu, Tiehan Cui, Zhaoteng Yan, Congying Liu, Datao You

机构 * School of Software, Henan University(河南大学软件学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22084 2025-05-29 cs.CV 79%

MObyGaze: a film dataset of multimodal objectification densely annotated by experts

Julie Tores, Elisa Ancarani, Lucile Sassatelli, Hui-Yin Wu, Clement Bergman, Lea Andolfi, Victor Ecrement, Remy Sun, Frederic Precioso, Thierry Devars, Magali Guaresi, Virginie Julliard, Sarah Lecossais

机构 * Université Côte d’Azur, CNRS, I3S, France(法国里沃利大学、法国国家科学研究中心、I3S研究所) Université Côte d’Azur, CNRS, Inria, I3S, France(法国里沃利大学、法国国家科学研究中心、法国国家科学研究院、I3S研究所) Institut Universitaire de France(法国大学研究院) Université Côte d’Azur, Inria, France(法国里沃利大学、法国国家科学研究院、法国) Université Côte d’Azur, CNRS, BCL, France(法国里沃利大学、法国国家科学研究中心、BCL研究所) Sorbonne Université, GRIPIC(索邦大学、GRIPIC研究所) Université Sorbonne Paris Nord, LabSIC(巴黎-索邦大学北校区、LabSIC研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22065 2025-05-29 cs.CV 79%

AquaMonitor: A multimodal multi-view image sequence dataset for real-life aquatic invertebrate biodiversity monitoring

Mikko Impiö, Philipp M. Rehsen, Tiina Laamanen, Arne J. Beermann, Florian Leese, Jenni Raitoharju

机构 * Finnish Environment Institute(芬兰环境研究所) Aquatic Ecosystem Research(水生态系统研究) Centre for Water and Environmental Research (ZWU)(水与环境研究中心(ZWU)) Faculty of Information Technology(信息科技学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10464 2025-05-28 eess.IV cs.CV 79%

HWA-UNETR: Hierarchical Window Aggregate UNETR for 3D Multimodal Gastric Lesion Segmentation

Jiaming Liang, Lihuan Dai, Xiaoqi Sheng, Xiangguang Chen, Chun Yao, Guihua Tao, Qibin Leng, Hongmin Cai, Xi Zhong

机构 * School of Computer Science and Engineering(计算机科学与工程学院) School of Future Technology(未来技术学院) South China University of Technology(华南理工大学) Department of Medical Imaging(医学影像科) Guangzhou Institute of Cancer Research(广州癌症研究所) the Affiliated Cancer Hospital(附属肿瘤医院) Guangzhou Medical University(广州医学院) Department of Radiology(放射科) Meizhou People’s Hospital(梅州市人民医院) School of Computer Science and Technology(计算机科学与技术学院) Hainan University(海南大学) Department of Oncology Institute(肿瘤研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments This work has been provisionally accepted for MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19474 2025-05-27 cs.AI 79%

Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models

Xinmiao Hu, Chun Wang, Ruihe An, ChenYu Shao, Xiaojun Ye, Sheng Zhou, Liangcheng Li

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments 21 pages, 19 figures, Submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08695 2025-05-27 cs.CV 79%

Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping

Yue Yang, Shuibai Zhang, Wenqi Shao, Kaipeng Zhang, Yi Bin, Yu Wang, Ping Luo

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07960 2025-05-27 cs.HC cs.CL 79%

AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments

Samuel Schmidgall, Rojin Ziaei, Carl Harris, Eduardo Reis, Jeffrey Jopling, Michael Moor

机构 * Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Stanford University Hospital Israelita Albert Einstein(斯坦福大学医院以色列阿尔伯特·爱因斯坦医院) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10714 2025-05-27 cs.CL 79%

GeoGrid-Bench: Can Foundation Models Understand Multimodal Gridded Geo-Spatial Data?

Bowen Jiang, Yangxinyu Xie, Xiaomeng Wang, Jiashu He, Joshua Bergerson, John K Hutchison, Jordan Branham, Camillo J Taylor, Tanwi Mallick

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17374 2025-05-26 cs.HC cs.CL 79%

Chart-to-Experience: Benchmarking Multimodal LLMs for Predicting Experiential Impact of Charts

Seon Gyeom Kim, Jae Young Choi, Ryan Rossi, Eunyee Koh, Tak Yeon Lee

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments This paper has been accepted to IEEE PacificVis 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17090 2025-05-26 cs.CV 79%

EmoSign: A Multimodal Dataset for Understanding Emotions in American Sign Language

Phoebe Chua, Cathy Mengying Fang, Takehiko Ohkawa, Raja Kushalnagar, Suranga Nanayakkara, Pattie Maes

机构 * MIT Media Lab(麻省理工学院媒体实验室) National University of Singapore(新加坡国立大学) The University of Tokyo(东京大学) Gallaudet University(美国聋人大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16770 2025-05-26 cs.CV 79%

RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs

Meng-Hao Guo, Xuanyu Chu, Qianrui Yang, Zhe-Han Mo, Yiqing Shen, Pei-lin Li, Xinjie Lin, Jinnian Zhang, Xin-Sheng Chen, Yi Zhang, Kiyohiro Nakayama, Zhengyang Geng, Houwen Peng, Han Hu, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan X(腾讯文英实验室) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10541 2025-05-26 cs.CV 79%

Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis

Pengfei Wang, Guohai Xu, Weinong Wang, Junjie Yang, Jie Lou, Yunhua Xue

机构 * Pengfei Wang(王鹏飞) Guohai Xu(徐国海) Weinong Wang(王文龙) Junjie Yang(杨俊杰) Jie Lou(娄杰) Yunhua Xue(许云华)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01441 2025-05-26 cs.AI cs.LG 79%

LMAct: A Benchmark for In-Context Imitation Learning with Long Multimodal Demonstrations

Anian Ruoss, Fabio Pardo, Harris Chan, Bonnie Li, Volodymyr Mnih, Tim Genewein

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16365 2025-05-26 cs.CL 79%

Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines

Zi-Ao Ma, Tian Lan, Rong-Cheng Tu, Yong Hu, Yu-Shi Zhu, Tong Zhang, Heyan Huang, Zhijing Wu, Xian-Ling Mao

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17021 2025-05-23 cs.CV 79%

ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark

Sara Ghaboura, Ketan More, Wafa Alghallabi, Omkar Thawakar, Jorma Laaksonen, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Github : https://github.com/mbzuai-oryx/ARB, Huggingface: https://huggingface.co/datasets/MBZUAI/ARB

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15472 2025-05-23 cs.CL 79%

PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions

Song Dai, Yibo Yan, Jiamin Su, Dongfang Zihao, Yubo Gao, Yonghua Hei, Jungang Li, Junyan Zhang, Sicheng Tao, Zhuoran Gao, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Future Brain Education Technology Co., Ltd.(北京未来脑教育科技有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03644 2025-05-23 cs.CV 79%

DongbaMIE: A Multimodal Information Extraction Dataset for Evaluating Semantic Understanding of Dongba Pictograms

Xiaojun Bi, Shuo Li, Junyao Xing, Ziyue Wang, Fuwen Luo, Weizheng Qiao, Lu Han, Ziwei Sun, Peng Li, Yang Liu

机构 * College of Information and Engineering, Minzu University of China(中国民族大学信息与工程学院) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(教育部民族语言智能分析与安全治理重点实验室) College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Our dataset can be obtained from: https://github.com/thinklis/DongbaMIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19140 2025-05-23 cs.CV 79%

Transformation trees -- documentation of multimodal image registration

Agnieszka Anna Tomaka, Dariusz Pojda, Michał Tarnawski, Leszek Luchowski

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 28 pages, 15 figures

Journal ref Computers in Biology and Medicine, Vol 193, year: 2025, pages: 110311

详情

展开后加载摘要…

URL PDF HTML 收藏