arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-17 至 2025-10-17 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2405.13571 2025-10-17 cs.CV 90%

Incomplete Multimodal Industrial Anomaly Detection via Cross-Modal Distillation

Wenbo Sui, Daniel Lichau, Josselin Lefèvre, Harold Phelippeau

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

Comments For a published version refer to the Information Fusion, DOI. 10.1016/j.inffus.2025.103572

Journal ref Sui, W., Lichau, D., Lefèvre, J., & Phelippeau, H. (2026). Incomplete multimodal industrial anomaly detection via cross-modal distillation. Information Fusion, 126, Article 103572

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14958 2025-10-17 cs.CV cs.CL 81%

MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning

Weikang Shi, Aldrich Yu, Rongyao Fang, Houxing Ren, Ke Wang, Aojun Zhou, Changyao Tian, Xinyu Fu, Yuxuan Hu, Zimu Lu, Linjiang Huang, Si Liu, Rui Liu, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(中文大学多媒体实验室) Huawei Research(华为研究) BUAA(北京航空学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Project Page: https://mathcanvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14307 2025-10-17 cs.CL cs.AI 81%

MERLIN: A Testbed for Multilingual Multimodal Entity Recognition and Linking

Sathyanarayanan Ramamoorthy, Vishwa Shah, Simran Khanuja, Zaid Sheikh, Shan Jie, Ann Chia, Shearman Chua, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Defence Science and Technology Agency(国防科学与技术局)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11817 2025-10-17 cs.CV 79%

GRAB: A Challenging GRaph Analysis Benchmark for Large Multimodal Models

Jonathan Roberts, Kai Han, Samuel Albanie

机构 * University of Cambridge(剑桥大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21851 2025-10-17 cs.CV 79%

On Large Multimodal Models as Open-World Image Classifiers

Alessandro Conti, Massimiliano Mancini, Enrico Fini, Yiming Wang, Paolo Rota, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at ICCV2025, 23 pages, 13 figures, code is available at https://github.com/altndrr/lmms-owc

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14905 2025-10-17 cs.CV 79%

Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation

Siwei Wen, Junyan Ye, Peilin Feng, Hengrui Kang, Zichen Wen, Yize Chen, Jiang Wu, Wenjun Wu, Conghui He, Weijia Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-Sen University(中山大学) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算高级创新中心,北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17040 2025-10-17 cs.CV cs.AI 73%

From Easy to Hard: The MIR Benchmark for Progressive Interleaved Multi-Image Reasoning

Hang Du, Jiayang Zhang, Guoshun Nan, Wendi Deng, Zhenyan Chen, Chenyang Zhang, Wang Xiao, Shan Huang, Yuqi Pan, Tao Qi, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14621 2025-10-17 cs.AI cs.CL 62%

ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks

Yuanyi Song, Heyuan Huang, Qiqiang Lin, Yin Zhao, Xiangmou Qu, Jun Wang, Xingyu Lou, Weiwen Liu, Zhuosheng Zhang, Jun Wang, Yong Yu, Weinan Zhang, Zhaoxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14443 2025-10-17 cs.SD cs.AI eess.AS 62%

Big Data Approaches to Bovine Bioacoustics: A FAIR-Compliant Dataset and Scalable ML Framework for Precision Livestock Welfare

Mayuri Kate, Suresh Neethirajan

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI、eess.AS

Comments 40 pages, 14 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14532 2025-10-17 cs.CV 57%

Towards Generalist Intelligence in Dentistry: Vision Foundation Models for Oral and Maxillofacial Radiology

Xinrui Huang, Fan Xiao, Dongming He, Anqi Gao, Dandan Li, Xiaofan Zhang, Shaoting Zhang, Xudong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine, Department of Oral Craniomaxillofacial(上海第九人民医院,上海交通大学医学院,口腔颅面医学部) Shanghai Jiao Tong University, School of Computer Science(上海交通大学,计算机科学学院) University of Electronic Science and Technology of China, School of Mechanical and Electrical Engineering(电子科技大学,机械与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University, College of Stomatology(上海交通大学,口腔医学院) National Center for Stomatology(国家口腔医学中心) National Clinical Medical Research Center for Oral Diseases(国家口腔疾病临床医学研究中心) Shanghai Key Laboratory of Stomatology(上海口腔医学重点实验室) Shanghai Research Institute of Stomatology(上海口腔研究所) Chinese Academy of Medical Science, Research Unit of Oral and Maxillofacial Regenerative Medicine(中国医学科学院,口腔颌面再生医学研究单元)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02535 2025-10-17 cs.CY cs.AI 57%

PHORECAST: Enabling AI Understanding of Public Health Outreach Across Populations

Rifaa Qadri, Anh Nhat Nhu, Swati Ramnath, Laura Yu Zheng, Raj Bhansali, Sylvette La Touche-Howard, Tracy Marie Zeeger, Tom Goldstein, Ming Lin

机构 * University of Maryland(马里兰大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏