arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-04 至 2025-08-04 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2503.06252 2025-08-04 cs.CV cs.AI 81%

Can Atomic Step Decomposition Enhance the Self-structured Reasoning of Multimodal Large Models?

Kun Xiang, Zhili Liu, Zihao Jiang, Yunshuang Nie, Kaixin Cai, Yiyang Yin, Runhui Huang, Haoxiang Fan, Hanhui Li, Weiran Huang, Yihan Zeng, Yu-Jie Yuan, Jianhua Han, Lanqing Hong, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2411.11930

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00726 2025-08-04 cs.CV 79%

MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models

Jiale Li, Mingrui Wu, Zixiang Jin, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Liujuan Cao, Rongrong Ji

机构 * Xiamen University(厦门大学) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments ACM MM25 has accepted this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14709 2025-08-04 cs.CV cs.RO 79%

DiFuse-Net: RGB and Dual-Pixel Depth Estimation using Window Bi-directional Parallax Attention and Cross-modal Transfer Learning

Kunal Swami, Debtanu Gupta, Amrit Kumar Muduli, Chirag Jaiswal, Pankaj Kumar Bajpai

机构 * Visual Intelligence Team, Samsung Research India Bangalore(三星印度班加罗尔视觉智能团队)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

Comments Accepted in IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11172 2025-08-04 cs.CV 79%

TerraMesh: A Planetary Mosaic of Multimodal Earth Observation Data

Benedikt Blumenstiel, Paolo Fraccaro, Valerio Marsocci, Johannes Jakubik, Stefano Maurogiovanni, Mikolaj Czerkawski, Rocco Sedona, Gabriele Cavallaro, Thomas Brunschwiler, Juan Bernabe-Moreno, Nicolas Longépé

机构 * IBM Research – Europe(IBM欧洲研究院) European Space Agency(欧洲航天局) roman_Φ -Lab(Φ实验室) Forschungszentrum Jülich(尤利奇研究中心) University of Iceland(冰岛大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR) Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20808 2025-08-04 cs.AI 79%

MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts

Peijie Wang, Zhong-Zhi Li, Fei Yin, Xin Yang, Dekang Ran, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(自动化研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments 45 pages, accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00615 2025-08-04 cs.LG cs.AI 57%

Similarity-Based Self-Construct Graph Model for Predicting Patient Criticalness Using Graph Neural Networks and EHR Data

Mukesh Kumar Sahu, Pinki Roy

机构 * National Institute of Technology Silchar, Assam, India(印度西里char国家理工学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16974 2025-08-04 cs.CV 57%

OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning

Zongyan Han, Jiale Cao, Shuo Chen, Tong Wang, Jorma Laaksonen, Rao Muhammad Anwer

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) Tianjin University(天津大学) Nanjing University(南京大学) Aalto University(艾尔沃斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11849 2025-08-04 cs.CV 57%

Towards a Unified Copernicus Foundation Model for Earth Vision

Yi Wang, Zhitong Xiong, Chenying Liu, Adam J. Stewart, Thomas Dujardin, Nikolaos Ioannis Bountos, Angelos Zavras, Franziska Gerken, Ioannis Papoutsis, Laura Leal-Taixé, Xiao Xiang Zhu

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) National Technical University of Athens & National Observatory of Athens(雅典国家技术大学及雅典国家天文台) Harokopio University of Athens(雅典哈罗科波斯大学) NVIDIA(NVIDIA公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. 33 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15170 2025-08-04 cs.CR 50%

From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem

Yanxu Mao, Tiehan Cui, Peipei Liu, Datao You, Hongsong Zhu

专题命中 多模态评测 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏