arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-29 至 2025-09-29 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2509.21451 2025-09-29 cs.CV cs.CL 84%

VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding

Abdul Waheed, Zhen Wu, Dareen Alharthi, Seungone Kim, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21365 2025-09-29 cs.CV cs.AI 84%

MAJORScore: A Novel Metric for Evaluating Multimodal Relevance via Joint Representation

Zhicheng Du, Qingyang Shi, Jiasheng Lu, Yingshan Liang, Xinyu Zhang, Yiran Wang, Peiwu Qin

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05271 2025-09-29 cs.CV 83%

Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu, Lixin Gu, Xuehui Wang, Qingyun Li, Yiming Ren, Zixuan Chen, Jiapeng Luo, Jiahao Wang, Tan Jiang, Bo Wang, Conghui He, Botian Shi, Xingcheng Zhang, Han Lv, Yi Wang, Wenqi Shao, Pei Chu, Zhongying Tu, Tong He, Zhiyong Wu, Huipeng Deng, Jiaye Ge, Kai Chen, Kaipeng Zhang, Limin Wang, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) Nanjing University(南京大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22377 2025-09-29 cs.CV 79%

Effectiveness of Large Multimodal Models in Detecting Disinformation: Experimental Results

Yasmina Kheddache, Marc Lalonde

机构 * Département d’informatique et recherche opérationnelle (D.I.R.O.) Université de Montréal Pavillon André-Aisenstadt 2920, chemin de la Tour Montréal (QC) H3T 1N8(蒙特利尔大学计算机与运筹学系) R&D Dept. Computer Research Institute of Montreal (CRIM) 405 Ogilvy Ave., #101 Montreal, Qc, Canada(蒙特利尔计算机研究 institute)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22019 2025-09-29 cs.CV 79%

EgoInstruct: An Egocentric Video Dataset of Face-to-face Instructional Interactions with Multi-modal LLM Benchmarking

Yuki Sakai, Ryosuke Furuta, Juichun Yen, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

Comments Accepted to the I-HFM Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21805 2025-09-29 cs.CL 79%

Towards Minimal Causal Representations for Human Multimodal Language Understanding

Menghua Jiang, Yuncheng Jiang, Haifeng Hu, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院) School of Electronics and Information Technology, Sun Yat-sen University(中山大学电子与信息学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21600 2025-09-29 cs.AI cs.LG 79%

Automated and Interpretable Survival Analysis from Multimodal Data

Mafalda Malafaia, Peter A. N. Bosman, Coen Rasch, Tanja Alderliesten

机构 * Centrum Wiskunde & Informatica(数学与信息学研究中心) Delft University of Technology(代尔夫特理工大学) Leiden University Medical Center(莱顿大学医学中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments 4 figures; 4 tables; 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16044 2025-09-29 eess.AS cs.LG eess.IV eess.SP 79%

Multimodal Biomarkers for Schizophrenia: Towards Individual Symptom Severity Estimation

Gowtham Premananth, Philip Resnik, Sonia Bansal, Deanna L. Kelly, Carol Espy-Wilson

机构 * Department of Electrical \& Computer Engineering Institute for Advanced Computer Studies School of Medicine

专题命中 多模态评测 :multimodal(title,abstract);分类 eess.AS

Comments Accepted to be presented at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21352 2025-09-29 cs.CV cs.LG 79%

Improving Autism Detection with Multimodal Behavioral Analysis

William Saakyan, Matthias Norden, Lola Eversmann, Simon Kirsch, Muyu Lin, Simon Guendelman, Isabel Dziobek, Hanna Drimalla

机构 * Center for Cognitive Interaction Technology (CITEC), Bielefeld University(认知交互技术中心(CITEC),比勒菲尔德大学) Institute of Psychology, Humboldt University of Berlin(心理学研究所,洪堡大学) Department of Psychiatry and Psychotherapy, Medical Center-University of Freiburg(精神病学与心理治疗系,弗赖堡医学院-大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21396 2025-09-29 cs.CV cs.LG 74%

mmHSense: Multi-Modal and Distributed mmWave ISAC Datasets for Human Sensing

Nabeel Nisar Bhat, Maksim Karnaukh, Stein Vandenbroeke, Wouter Lemoine, Jakob Struye, Jesus Omar Lacruz, Siddhartha Kumar, Mohammad Hossein Moghaddam, Joerg Widmer, Rafael Berkvens, Jeroen Famaey

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22518 2025-09-29 cs.AI cs.LG 57%

REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model

Bo Li, Guanzhi Deng, Ronghao Chen, Junrong Yue, Shuo Zhang, Qinghua Zhao, Linqi Song, Lijie Wen

机构 * Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航) Baidu Inc(百度公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22228 2025-09-29 cs.CV 57%

UrbanFeel: A Comprehensive Benchmark for Temporal and Perceptual Understanding of City Scenes through Human Perspective

Jun He, Yi Lin, Zilong Huang, Jiacong Yin, Junyan Ye, Yuchuan Zhou, Weijia Li, Xiang Zhang

机构 * Sun Yat-sen University(中山大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21450 2025-09-29 cs.CL 57%

LLM-Based Support for Diabetes Diagnosis: Opportunities, Scenarios, and Challenges with GPT-5

Gaurav Kumar Gupta, Nirajan Acharya, Pranal Pande

机构 * Youngstown State University(扬斯敦州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01188 2025-09-29 cs.LG cs.AI 57%

SpectrumWorld: Artificial Intelligence Foundation for Spectroscopy

Zhuo Yang, Jiaqing Xie, Shuaike Shen, Daolang Wang, Yeyun Chen, Ben Gao, Shuzhou Sun, Biqing Qi, Dongzhan Zhou, Lei Bai, Linjiang Chen, Shufei Zhang, Qinying Gu, Jun Jiang, Tianfan Fu, Yuqiang Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) North University of China(北方大学) Center for Machine Vision and Signal Analysis (CMVS), University of Oulu(奥卢大学机器视觉与信号分析中心) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Shanghai Innovation Institute(上海创新研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21875 2025-09-29 cs.CL 57%

WildSpeech-Bench: Benchmarking End-to-End SpeechLLMs in the Wild

Linhao Zhang, Jian Zhang, Bokai Lei, Chuhan Wu, Aiwei Liu, Wei Jia, Xiao Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(模式识别中心、微信AI、腾讯公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10434 2025-09-29 cs.RO cs.CV cs.LG 57%

Learning Personalized Driving Styles via Reinforcement Learning from Human Feedback

Derun Li, Changye Li, Yue Wang, Jianwei Ren, Xin Wen, Pengxiang Li, Leimeng Xu, Kun Zhan, Peng Jia, Xianpeng Lang, Ningyi Xu, Hang Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Qi Zhi Institute(上海启智研究院) Peking University(北京大学) LiAuto Tsinghua University(清华大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18788 2025-09-29 cs.RO cs.CV 57%

Excavating in the Wild: The GOOSE-Ex Dataset for Semantic Segmentation

Raphael Hagmanns, Peter Mortimer, Miguel Granero, Thorsten Luettel, Janko Petereit

机构 * Fraunhofer Institute of Optronics, System Technologies and Image Exploitation(弗劳恩霍夫光学与系统技术研究所) Institute for Autonomous Systems Technology, University of the Bundeswehr Munich(联邦国防军慕尼黑大学自主系统技术研究所) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments Accepted for publication at 2025 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21341 2025-09-29 cs.NE cs.AI cs.LG 57%

From Embeddings to Equations: Genetic-Programming Surrogates for Interpretable Transformer Classification

Mohammad Sadegh Khorshidi, Navid Yazdanjue, Hassan Gharoun, Mohammad Reza Nikoo, Fang Chen, Amir H. Gandomi

机构 * Faculty of Engineering & Information Technology, University of Technology Sydney(工程与信息技术学院,技术悉尼大学) Department of Civil and Architectural Engineering, Sultan Qaboos University(土木与建筑学院,苏丹·卡布斯大学) University Research and Innovation Center (EKIK), Obuda University(研究与创新中心(EKIK),布达佩斯大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

Comments 20 pages, 8 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22334 2025-09-29 cs.CY 50%

MakOne: Behavioural Data of University Students' Smart Devices in Uganda

Michael Kizito, Ivan Kayongo, Hawa Nyende, Halimu Chongomweru, Lillian Muyama, Roy Alia Asiku, Alice Mugisha

专题命中 多模态评测 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04278 2025-09-29 cs.HC 50%

EmoPrefer: Can Large Language Models Understand Human Emotion Preferences?

Zheng Lian, Licai Sun, Lan Chen, Haoyu Chen, Zebang Cheng, Fan Zhang, Ziyu Jia, Ziyang Ma, Fei Ma, Xiaojiang Peng, Jianhua Tao

专题命中 多模态评测 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏