arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-07-30 至 2025-07-30 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2506.09081 2025-07-30 cs.CV cs.AI cs.CL 85%

FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation

Zheqi He, Yesheng Liu, Jing-shu Zheng, Xuejing Li, Jin-Ge Yao, Bowen Qin, Richeng Xuan, Xi Yang

机构 * BAAI FlagEval Team(BAAI 评测团队)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by ACL 2025 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20217 2025-07-30 cs.RO cs.AI cs.CV 84%

Humanoid Occupancy: Enabling A Generalized Multimodal Occupancy Perception System on Humanoid Robots

Wei Cui, Haoyu Wang, Wenkang Qin, Yijie Guo, Gang Han, Wen Zhao, Jiahang Cao, Zhang Zhang, Jiaru Zhong, Jingkai Sun, Pihai Sun, Shuai Shi, Botuo Jiang, Jiahao Ma, Jiaxu Wang, Hao Cheng, Zhichao Liu, Yang Wang, Zheng Zhu, Guan Huang, Jian Tang, Qiang Zhang

机构 * X-Humanoid GigaAI Project(GigaAI项目)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21924 2025-07-30 cs.CV 79%

MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning

Tianhong Gao, Yannian Fu, Weiqun Wu, Haixiao Yue, Shanshan Liu, Gang Zhang

机构 * Baidu Inc.(百度公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16876 2025-07-30 q-bio.QM cs.AI cs.LG 79%

Machine learning-based multimodal prognostic models integrating pathology images and high-throughput omic data for overall survival prediction in cancer: a systematic review

Charlotte Jennings, Andrew Broad, Lucy Godson, Emily Clarke, David Westhead, Darren Treanor

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments Main article (50 pages, inc 3 tables, 4 figures). Supplementary material included with additional methodological information and data

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21619 2025-07-30 cs.CV 70%

EMIT: Enhancing MLLMs for Industrial Anomaly Detection via Difficulty-Aware GRPO

Wei Guan, Jun Lan, Jian Cao, Hao Tan, Huijia Zhu, Weiqiang Wang

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21157 2025-07-30 cs.CR cs.CV 70%

Unmasking Synthetic Realities in Generative AI: A Comprehensive Review of Adversarially Robust Deepfake Detection Systems

Naseem Khan, Tuan Nguyen, Amine Bermak, Issa Khalil

机构 * Department of Computer Science(计算机科学系) Hamad bin Khalifa University(哈马德·本·哈利法大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 27 pages, 4 Tables, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21104 2025-07-30 cs.CL cs.AI 62%

iLSU-T: an Open Dataset for Uruguayan Sign Language Translation

Ariel E. Stassi, Yanina Boria, J. Matías Di Martino, Gregory Randall

机构 * Universidad de la República(乌拉圭共和国大学) Universidad de Buenos Aires(布宜诺斯艾利斯大学) Universidad Católica del Uruguay(乌拉圭天主教大学) Duke University(杜克大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 5 figures, 19th International Conference on Automatic Face and Gesture Recognition IEEE FG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21335 2025-07-30 cs.CV 57%

Analyzing the Sensitivity of Vision Language Models in Visual Question Answering

Monika Shah, Sudarshan Balaji, Somdeb Sarkhel, Sanorita Dey, Deepak Venugopal

机构 * University of Memphis, TN, USA(密苏里大学) Adobe Research, San Jose, CA, USA(Adobe研究院) University of Maryland Baltimore County, USA(马里兰大学巴尔的摩县分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21520 2025-07-30 cs.IR 50%

Solution for Meta KDD Cup'25: A Comprehensive Three-Step Framework for Vision Question Answering

Zijian Zhang, Xiaocheng Zhang, Yang Zhou, Zhimin Lin, Peng Yan

专题命中 多模态评测 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏