arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-08 至 2025-08-08 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 13 篇

2508.05602 2025-08-08 cs.CV 90%

LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model

Tao Sun, Oliver Liu, JinJin Li, Lan Ma

机构 * Stony Brook University(斯通布罗克大学) Amazon(亚马逊)

专题命中 多模态评测 :multimodal(title,abstract);image-text(title,abstract);MLLM(abstract);分类 cs.CV

Comments Published in the First Workshop of Evaluation of Multi-Modal Generation 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07689 2025-08-08 cs.CV cs.MM cs.RO 81%

RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving

Zhijian Huang, Chengjian Feng, Feng Yan, Baihui Xiao, Zequn Jie, Yujie Zhong, Xiaodan Liang, Lin Ma

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Meituan(美团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05527 2025-08-08 cs.CV 79%

AI vs. Human Moderators: A Comparative Evaluation of Multimodal LLMs in Content Moderation for Brand Safety

Adi Levi, Or Levi, Sardhendu Mishra, Jonathan Morra

机构 * Zefr Inc(Zefr公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted to the Computer Vision in Advertising and Marketing (CVAM) workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05083 2025-08-08 cs.AI 79%

MedMKEB: A Comprehensive Knowledge Editing Benchmark for Medical Multimodal Large Language Models

Dexuan Xu, Jieyi Wang, Zhongyan Chai, Yongzhi Cao, Hanpin Wang, Huamin Zhang, Yu Huang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05053 2025-08-08 cs.CV 79%

Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?

Parth Thakkar, Ankush Agarwal, Prasad Kasu, Pulkit Bansal, Chaitanya Devaguptapu

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

Comments Accepted at ACL 2025 in the main track

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04088 2025-08-08 cs.CL 79%

GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning

Jianghangfan Zhang, Yibo Yan, Kening Zheng, Xin Zou, Song Dai, Xuming Hu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04963 2025-08-08 cs.IR cs.LG 78%

A Metric for MLLM Alignment in Large-scale Recommendation

Yubin Zhang, Yanhua Huang, Haiming Xu, Mingliang Qi, Chang Wang, Jiarui Jin, Xiangyuan Ren, Xiaodan Wang, Ruiwen Xu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 多模态评测 :MLLM(title);multimodal(abstract)

Comments Pre-print.Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04746 2025-08-08 cs.LG 78%

A Foundational Multi-Modal Model for Few-Shot Learning

Pengtao Dang, Tingbo Guo, Sha Cao, Chi Zhang

机构 * Oregon Health & Science University(俄勒冈健康与科学大学)

专题命中 多模态评测 :multi-modal(title,abstract)

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02255 2025-08-08 eess.AS cs.LG cs.MM cs.SD 73%

MidiCaps: A large-scale MIDI dataset with text captions

Jan Melechovsky, Abhinaba Roy, Dorien Herremans

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS

Comments Accepted in ISMIR2024

Journal ref Proceedings of ISMIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05019 2025-08-08 cs.CV cs.AI cs.LG 62%

Skin-SOAP: A Weakly Supervised Framework for Generating Structured SOAP Notes

Sadia Kamal, Tim Oates, Joy Wan

机构 * Department of Computer Science, University of Maryland, Baltimore County(计算机科学系,马里兰大学巴尔的摩县分校) Department of Dermatology, Johns Hopkins University School of Medicine(皮肤科系,约翰霍普金斯大学医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to IJCAI 2025 Workshops. arXiv admin note: substantial text overlap with arXiv:2506.10328

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05377 2025-08-08 cs.IR cs.MM 57%

Does Multimodality Improve Recommender Systems as Expected? A Critical Analysis and Future Directions

Hongyu Zhou, Yinan Zhang, Aixin Sun, Zhiqi Shen

专题命中 多模态评测 :multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17653 2025-08-08 cs.MM cs.IR 57%

QuMAB: Query-based Multi-Annotator Behavior Modeling with Reliability under Sparse Labels

Liyun Zhang, Zheng Lian, Hong Liu, Takanori Takebe, Yuta Nakashima

专题命中 多模态评测 :multimodal(abstract);分类 cs.MM

Comments 12 pages. arXiv admin note: substantial text overlap with arXiv:2503.15237

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09525 2025-08-08 cs.MM 57%

SimLabel: Similarity-Weighted Iterative Framework for Multi-annotator Learning with Missing Annotations

Liyun Zhang, Zheng Lian, Hong Liu, Takanori Takebe, Yuta Nakashima

专题命中 多模态评测 :multimodal(abstract);分类 cs.MM

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏