arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-18 至 2025-08-18 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2508.10955 2025-08-18 cs.CV cs.CL cs.MM 85%

Empowering Multimodal LLMs with External Tools: A Comprehensive Survey

Wenbin An, Jiahao Nie, Yaqiang Wu, Feng Tian, Shijian Lu, Qinghua Zheng

机构 * School of Automation Science and Engineering, Xi’an Jiaotong University(自动化科学与工程学院,西安交通大学) Interdisciplinary Graduate Programme, Nanyang Technological University(跨学科研究生项目,南洋理工大学) Lenovo Research, Lenovo(联想研究院,联想) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.MM

Comments 21 pages, 361 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11021 2025-08-18 cs.CV cs.CL 81%

Can Multi-modal (reasoning) LLMs detect document manipulation?

Zisheng Liang, Kidus Zewde, Rudra Pratap Singh, Disha Patil, Zexi Chen, Jiayu Xue, Yao Yao, Yifei Chen, Qinzhe Liu, Simiao Ren

机构 * Duke University(杜克大学) Indian Institute of Technology, Roorkee(印度理工学院,罗尔基) New York University(纽约大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Wisconsin Madison(威斯康星大学麦迪逊分校) Columnbia University(哥伦比亚大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL

Comments arXiv admin note: text overlap with arXiv:2503.20084

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18932 2025-08-18 cs.MM cs.CL 81%

MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks

Lei Zhang, Xin Zhou, Chaoyue He, Di Wang, Yi Wu, Hong Xu, Wei Liu, Chunyan Miao

机构 * Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments Accepted at ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10916 2025-08-18 cs.HC cs.AI cs.CY cs.MA 74%

Multimodal Quantitative Measures for Multiparty Behaviour Evaluation

Ojas Shirekar, Wim Pouw, Chenxu Hao, Vrushank Phadnis, Thabo Beeler, Chirag Raman

机构 * TU Delft(代尔夫特理工大学) Tilburg University(蒂尔堡大学) Google(谷歌公司)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18057 2025-08-18 cs.CV cs.CL 73%

CLEAR: Character Unlearning in Textual and Visual Modalities

Alexey Dontsov, Dmitrii Korzh, Alexey Zhavoronkin, Boris Mikheev, Denis Bobkov, Aibek Alanov, Oleg Y. Rogov, Ivan Oseledets, Elena Tutubalina

机构 * AIRI HSE University(俄罗斯高等经济大学) Skoltech(斯克里普契克技术大学) Sber AI(俄罗斯储蓄银行人工智能实验室) MTUCI(莫斯科国立大学) MIPT(米哈伊尔戈尔斯基理工学院) ISP RAS Research Center for Trusted AI(俄罗斯科学院信息与系统问题研究所可信人工智能研究中心)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Journal ref https://aclanthology.org/2025.findings-acl.1058/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11058 2025-08-18 cs.CV cs.MM 62%

Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset

Wentao Mo, Qingchao Chen, Yuxin Peng, Siyuan Huang, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术王先院,北京大学) National Institute of Health Data Science, Peking University(健康数据科学国家研究院,北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepeted to ACM MM 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11536 2025-08-18 cs.CL 57%

Language models align with brain regions that represent concepts across modalities

Maria Ryskina, Greta Tuckute, Alexander Fung, Ashley Malkin, Evelina Fedorenko

机构 * Vector Institute for AI(向量人工智能研究所) MIT(麻省理工学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL

Comments Accepted to COLM 2025. Code and data can be found at https://github.com/ryskina/concepts-brain-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10947 2025-08-18 cs.CV 57%

MedAtlas: Evaluating LLMs for Multi-Round, Multi-Task Medical Reasoning Across Diverse Imaging Modalities and Clinical Text

Ronghao Xu, Zhen Huang, Yangbo Wei, Xiaoqian Zhou, Zikang Xu, Ting Liu, Zihang Jiang, S. Kevin Zhou

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06570 2025-08-18 cs.CV cs.LG 57%

ImpliHateVid: A Benchmark Dataset and Two-stage Contrastive Learning Framework for Implicit Hate Speech Detection in Videos

Mohammad Zia Ur Rehman, Anukriti Bhatnagar, Omkar Kabde, Shubhi Bansal, Nagendra Kumar

机构 * Indian Institute of Technology Indore(印度理工学院印地尔分校) Chaitanya Bharathi Institute of Technology(恰伊坦亚·巴哈蒂技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments Published in ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏