arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-22 至 2025-10-22 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 13 篇

2510.18583 2025-10-22 cs.CV cs.LG 85%

CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder

Yongmin Lee, Hye Won Chung

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00063 2025-10-22 astro-ph.IM cs.AI 83%

AstroMMBench: A Benchmark for Evaluating Multimodal Large Language Models Capabilities in Astronomy

Jinghang Shi, Xiaoyu Tang, Yang Huang, Yuyang Li, Xiao Kong, Yanxia Zhang, Caizhan Yue

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18014 2025-10-22 cs.CV cs.MM 81%

ManzaiSet: A Multimodal Dataset of Viewer Responses to Japanese Manzai Comedy

Kazuki Kawamura, Kengo Nakai, Jun Rekimoto

机构 * Sony CSL Kyoto(索尼 CSL 京都) The University of Tokyo(东京大学) Yoshimoto Kogyo Holdings Co., Ltd.(吉村工业株式会社)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

Comments ICCV 2025 Workshop on Affective & Behavior Analysis in-the-Wild (ABAW), Honolulu, HI, USA (Oct 19, 2025, HST). 11 pages, 5 figures

Journal ref ICCV 2025 Workshops (ICCVW) / CVF Open Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02537 2025-10-22 cs.CV cs.AI 81%

VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning

Hao Yan, Xingchen Liu, Hao Wang, Zhenbiao Cao, Handong Zheng, Liang Yin, Xinxing Su, Zihao Chen, Jihao Wu, Minghui Liao, Chao Weng, Wei Chen, Yuliang Liu, Xiang Bai

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18483 2025-10-22 cs.AI 79%

StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking

Haoran Zhang, Chenhao Zhu, Sicong Guo, Hanzhe Guo, Haiming Li, Donglin Yu

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18377 2025-10-22 cs.CV 79%

Cross-Modal Scene Semantic Alignment for Image Complexity Assessment

Yuqing Luo, Yixiao Li, Jiang Liu, Jun Fu, Hadi Amirpour, Guanghui Yue, Baoquan Zhao, Padraig Corcoran, Hantao Liu, Wei Zhou

机构 * School of Computer Science Cardiff University(卡迪夫大学计算机科学学院) School of Mathematical Sciences Beihang University(北航数学科学学院) Department of Information Technology University of Klagenfurt(克雷格弗特大学信息技术系) School of Biomedical Engineering Shenzhen University(深圳大学生物医学工程学院) School of Artificial Intelligence Sun Yat-sen University(中山大学人工智能学院)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

Comments 14 pages,2 figures, British Machine Vision Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09507 2025-10-22 cs.AI 79%

An Automated Multi-modal Evaluation Framework for Mobile Intelligent Assistants Based on Large Language Models and Multi-Agent Collaboration

Meiping Wang, Jian Zhong, Rongduo Han, Liming Kang, Zhengkun Shi, Xiao Liang, Xing Lin, Nan Gao, Haining Zhang

机构 * College of Software, Nankai University(南开大学软件学院) vivo AI Lab(vivo人工智能实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18336 2025-10-22 eess.SP 78%

MCANet: A Coherent Multimodal Collaborative Attention Network for Advanced Modulation Recognition in Adverse Noisy Environments

Wangye Jiang, Haoming Yang, Xinyu Lu, Mingyuan Wang, Huimei Sun, Jingya Zhang

专题命中 多模态评测 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05542 2025-10-22 cs.LG 78%

DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training

Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 多模态评测 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18029 2025-10-22 cs.DB cs.AI 74%

DynaQuery: A Self-Adapting Framework for Querying Structured and Multimodal Data

Aymane Hassini

机构 * Al Akhawayn University(阿尔阿克哈文大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

Comments 15 pages, 2 figures, 10 tables. Source code and experimental artifacts are available at: https://github.com/aymanehassini/DynaQuery . The 'DynaQuery-Eval-5K' benchmark, introduced in this work, is also publicly available at: https://www.kaggle.com/datasets/aymanehassini/dynaquery-eval-5k-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18339 2025-10-22 cs.CL cs.LG 57%

ECG-LLM -- training and evaluation of domain-specific large language models for electrocardiography

Lara Ahrens, Wilhelm Haverkamp, Nils Strodthoff

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

Comments 34 pages, 8 figures, code available at https://github.com/AI4HealthUOL/ecg-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16034 2025-10-22 cs.MA cs.AI cs.LG 57%

Disaster Management in the Era of Agentic AI Systems: A Vision for Collective Human-Machine Intelligence for Augmented Resilience

Bo Li, Junwei Ma, Kai Yin, Yiming Xiao, Chia-Wei Hsu, Ali Mostafavi

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22700 2025-10-22 cs.CV 57%

Global Prompt Refinement with Non-Interfering Attention Masking for One-Shot Federated Learning

Zhuang Qi, Pan Yu, Lei Meng, Sijin Zhou, Han Yu, Xiaoxiao Li, Xiangxu Meng

机构 * School of Software, Shandong University(山东大学软件学院) AIM Lab, Faculty of Engineering, Monash University(莫纳什大学工程学院AIM实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Electrical and Computer Engineering, University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) Vector Institute, Canada(加拿大向量研究所)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

Comments NeurIPS'25 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏