arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9204 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9204 篇

2507.04412 2025-07-08 cs.CV 74%

SFOOD: A Multimodal Benchmark for Comprehensive Food Attribute Analysis Beyond RGB with Spectral Insights

Zhenbo Xu, Jinghan Yang, Gong Huang, Jiqing Feng, Liu Liu, Ruihan Sun, Ajin Meng, Zhuo Zhang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ShiFang Technology Inc.(ShiFang技术有限公司) Specrizion Technology Co.Ltd(Specrizion技术有限公司)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11142 2025-07-08 cs.CV 74%

ISLES'24 -- A Real-World Longitudinal Multimodal Stroke Dataset

Evamaria Olga Riedel, Ezequiel de la Rosa, The Anh Baran, Moritz Hernandez Petzsche, Hakim Baazaoui, Kaiyuan Yang, Fabio Antonio Musio, Houjing Huang, David Robben, Joaquin Oscar Seia, Roland Wiest, Mauricio Reyes, Ruisheng Su, Claus Zimmer, Tobias Boeckh-Behrens, Maria Berndt, Bjoern Menze, Daniel Rueckert, Benedikt Wiestler, Susanne Wegener, Jan Stefan Kirschke

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01278 2025-07-03 cs.CL 74%

Evaluating Large Language Models for Multimodal Simulated Ophthalmic Decision-Making in Diabetic Retinopathy and Glaucoma Screening

Cindy Lie Tabuse, David Restepo, Carolina Gracitelli, Fernando Korn Malerbi, Caio Regatieri, Luis Filipe Nakayama

机构 * Ophthalmology Department, São Paulo Federal University(圣保罗联邦大学眼科部) Université Paris-Saclay, CentraleSupélec, Mathematics and Computer Science Laboratory(巴黎萨克莱大学、中央超导实验室数学与计算机科学实验室) Laboratory for Computational Physiology, Massachusetts Institute of Technology(计算生理学实验室、麻省理工学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23120 2025-07-01 cs.CV 74%

Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation

Zhenhua Ning, Zhuotao Tian, Shaoshuai Shi, Guangming Lu, Daojing He, Wenjie Pei, Li Jiang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12936 2025-06-17 cs.CL 74%

CliniDial: A Naturally Occurring Multimodal Dialogue Dataset for Team Reflection in Action During Clinical Operation

Naihao Deng, Kapotaksha Das, Rada Mihalcea, Vitaliy Popov, Mohamed Abouelenien

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Michigan, Dearborn(密歇根大学德雷本分校)

专题命中 多模态评测 :multimodal(title);分类 cs.CL

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05517 2025-06-17 cs.CV 74%

Evaluation of Vision Transformers for Multimodal Image Classification: A Case Study on Brain, Lung, and Kidney Tumors

Óscar A. Martín, Javier Sánchez

机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心) Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(大学信息学与企业与社会研究所) University of Las Palmas de Gran Canaria(拉斯帕尔马斯德格拉纳达大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments 19 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06218 2025-06-09 cs.CV 74%

STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving

Christian Fruhwirth-Reisinger, Dušan Malić, Wei Lin, David Schinagl, Samuel Schulter, Horst Possegger

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

Comments Dataset: https://huggingface.co/datasets/ivc-lrp/STSBench, Code: https://github.com/LRP-IVC/STSBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06176 2025-06-09 cs.CV 74%

SatelliteFormula: Multi-Modal Symbolic Regression from Remote Sensing Imagery for Physics Discovery

Zhenyu Yu, Mohd. Yamani Idna Idris, Pei Wang, Yuelong Xia, Fei Ma, Rizwan Qureshi

机构 * Universiti Malaya(马来大学) Kunming University of Science and Technology(昆明理工大学) Yunnan Normal University(云南师范大学) Guangming Laboratory(光明实验室) University of Central Florida(佛罗里达大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00814 2025-06-09 cs.CL 74%

GuessBench: Sensemaking Multimodal Creativity in the Wild

Zifeng Zhu, Shangbin Feng, Herun Wan, Ningnan Wang, Minnan Luo, Yulia Tsvetkov

机构 * Xi’an Jiaotong University(西安交通大学) University of Washington(华盛顿大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02626 2025-05-06 cs.CV 74%

Detect, Classify, Act: Categorizing Industrial Anomalies with Multi-Modal Large Language Models

Sassan Mokhtar, Arian Mousakhan, Silvio Galesso, Jawad Tayyub, Thomas Brox

机构 * University of Bonn(波恩大学) University of Freiburg(弗赖堡大学) Endress + Hauser(Endress+Hauser公司)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

Comments Accepted as a spotlight presentation paper at the VAND Workshop, CVPR 2025. 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10123 2025-04-15 cs.CV 74%

M2S-RoAD: Multi-Modal Semantic Segmentation for Road Damage Using Camera and LiDAR Data

Tzu-Yun Tseng, Hongyu Lyu, Josephine Li, Julie Stephany Berrio, Mao Shan, Stewart Worrall

机构 * Australian Centre for Robotics (ACFR), The University of Sydney(澳大利亚机器人中心(ACFR),悉尼大学) University of Washington(华盛顿大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23507 2025-04-01 cs.CV cs.LG eess.IV physics.med-ph 74%

Federated Self-Supervised Learning for One-Shot Cross-Modal and Cross-Imaging Technique Segmentation

Siladittya Manna, Suresh Das, Sayantari Ghosh, Saumik Bhattacharya

机构 * Hong Kong Baptist University(香港浸会大学) Narayana Superspeciality Hospital(纳拉亚纳超级专科医院) National Institute of Technology Durgapur(杜尔加布尔国家理工学院) Indian Institute of Technology(印度理工学院)

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21268 2025-03-28 cs.CV 74%

ClimbingCap: Multi-Modal Dataset and Method for Rock Climbing in World Coordinate

Ming Yan, Xincheng Lin, Yuhua Luo, Shuqi Fan, Yudi Dai, Qixin Zhong, Lincai Zhong, Yuexin Ma, Lan Xu, Chenglu Wen, Siqi Shen, Cheng Wang

机构 * Xiamen University(厦门大学) School of Informatics, Xiamen University(厦门大学信息学院) China National Climbing Team(国家攀岩队) Ningbo Sports Work Training Team(宁波市体育工作训练队) ShanghaiTech University(上海科技大学) ETH Zürich(苏黎世联邦理工学院) ETH AI Center, ETH Zürich(苏黎世联邦理工学院AI中心)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

Comments CVPR2025, project in \href{this link}{http://www.lidarhumanmotion.net/climbingcap/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10684 2025-03-28 eess.IV cs.CV cs.LG 74%

HIST-AID: Leveraging Historical Patient Reports for Enhanced Multi-Modal Automatic Diagnosis

Haoxu Huang, Cem M. Deniz, Kyunghyun Cho, Sumit Chopra, Divyam Madaan

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

Comments In Proceedings of Machine Learning for Health

Journal ref PMLR 259(2025):502-523

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06380 2025-03-25 cs.CV cs.LG cs.RO 74%

Adver-City: Open-Source Multi-Modal Dataset for Collaborative Perception Under Adverse Weather Conditions

Mateus Karvat, Sidney Givigi

机构 * School of Computing, Queen’s University(女王大学计算学院)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05031 2025-03-14 cs.CV cs.LG cs.RO 74%

ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark

Ronghao Dang, Yuqian Yuan, Wenqi Zhang, Yifei Xin, Boqiang Zhang, Long Li, Liuyi Wang, Qinyang Zeng, Xin Li, Lidong Bing

机构 * Alibaba DAMO Academy(阿里巴巴达摩院) Zhejiang University(浙江大学) Tongji University(同济大学) Shanda AI Research Institute(山大人工智能研究院)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10118 2025-03-12 cs.CL 74%

SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages

Holy Lovenia, Rahmad Mahendra, Salsabil Maulana Akbar, Lester James V. Miranda, Jennifer Santoso, Elyanah Aco, Akhdan Fadhilah, Jonibek Mansurov, Joseph Marvin Imperial, Onno P. Kampman, Joel Ruben Antony Moniz, Muhammad Ravi Shulthan Habibi, Frederikus Hudi, Railey Montalan, Ryan Ignatius, Joanito Agili Lopo, William Nixon, Börje F. Karlsson, James Jaya, Ryandito Diandaru, Yuze Gao, Patrick Amadeus, Bin Wang, Jan Christian Blaise Cruz, Chenxi Whitehouse, Ivan Halim Parmonangan, Maria Khelli, Wenyu Zhang, Lucky Susanto, Reynard Adha Ryanda, Sonny Lazuardi Hermawan, Dan John Velasco, Muhammad Dehan Al Kautsar, Willy Fitra Hendria, Yasmin Moslem, Noah Flynn, Muhammad Farid Adilazuarda, Haochen Li, Johanes Lee, R. Damanhuri, Shuo Sun, Muhammad Reza Qorib, Amirbek Djanibekov, Wei Qi Leong, Quyet V. Do, Niklas Muennighoff, Tanrada Pansuwan, Ilham Firdausi Putra, Yan Xu, Ngee Chia Tai, Ayu Purwarianti, Sebastian Ruder, William Tjhi, Peerat Limkonchotiwat, Alham Fikri Aji, Sedrick Keh, Genta Indra Winata, Ruochen Zhang, Fajri Koto, Zheng-Xin Yong, Samuel Cahyawijaya

机构 * AI Singapore(新加坡人工智能中心) IndoNLP(印尼自然语言处理研究组) Universitas Indonesia(印度尼西亚大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所) RevComm, Inc.(RevComm公司) Tohoku University(东北大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Bath(巴斯大学) National University Philippines(菲律宾国立大学) MOH Office for Healthcare Transformation (MOHT)(卫生部医疗转型办公室) NAIST(奈良科学技术研究所) Works Applications Lab(Works Applications实验室) Universitas Gadjah Mada(加查马达大学) Institut Teknologi Bandung(万隆理工学院) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Institute for Infocomm Research, A*STAR(新加坡资讯通信研究院(新加坡科技研究局下属)) Samsung Research Philippines(三星菲律宾研究院) University of Cambridge(剑桥大学) Queensland University of Technology(昆士兰科技大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL

Comments https://seacrowd.github.io/ Published in EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14195 2025-03-10 cs.CV cs.RO 74%

Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition

Tianyi Shang, Zhenyu Li, Pengjie Xu, Jinwei Qiao, Gang Chen, Zihan Ruan, Weijun Hu

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

Comments 8 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04992 2025-02-27 eess.IV cs.CV 74%

VisionFM: a Multi-Modal Multi-Task Vision Foundation Model for Generalist Ophthalmic Artificial Intelligence

Jianing Qiu, Jian Wu, Hao Wei, Peilun Shi, Minqing Zhang, Yunyun Sun, Lin Li, Hanruo Liu, Hongyi Liu, Simeng Hou, Yuyang Zhao, Xuehui Shi, Junfang Xian, Xiaoxia Qu, Sirui Zhu, Lijie Pan, Xiaoniao Chen, Xiaojia Zhang, Shuai Jiang, Kebing Wang, Chenlong Yang, Mingqiang Chen, Sujie Fan, Jianhua Hu, Aiguo Lv, Hui Miao, Li Guo, Shujun Zhang, Cheng Pei, Xiaojuan Fan, Jianqin Lei, Ting Wei, Junguo Duan, Chun Liu, Xiaobo Xia, Siqi Xiong, Junhong Li, Benny Lo, Yih Chung Tham, Tien Yin Wong, Ningli Wang, Wu Yuan

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

Journal ref The latest VisionFM work has been published in NEJM AI, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10114 2025-02-25 cs.CV 74%

FoMo: Multi-Modal, Multi-Scale and Multi-Task Remote Sensing Foundation Models for Forest Monitoring

Nikolaos Ioannis Bountos, Arthur Ouaknine, Ioannis Papoutsis, David Rolnick

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

Comments Accepted at the 39th Annual AAAI Conference on Artificial Intelligence, AI for Social Impact track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09818 2025-02-17 cs.CV 74%

On the robustness of multimodal language model towards distractions

Ming Liu, Hao Chen, Jindong Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Carnegie Mellon University(卡内基梅隆大学) William & Mary University(威廉玛丽大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09148 2025-02-14 cs.CV 74%

Multimodal HIE Lesion Segmentation in Neonates: A Comparative Study of Loss Functions

Annayah Usman, Abdul Haseeb, Tahir Syed

机构 * School of Mathematics and Computer Science, Institute of Business Administration(商业管理学院数学与计算机科学学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17880 2025-01-31 eess.SP cs.AI cs.LG cs.NA math.NA 74%

Assessment of the January 2025 Los Angeles County wildfires: A multi-modal analysis of impact, response, and population exposure

Seyd Teymoor Seydi

机构 * Boise State University(博伊西州立大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01189 2025-01-09 cs.LG cs.AI 74%

MultiMax: Sparse and Multi-Modal Attention Learning

Yuxuan Zhou, Mario Fritz, Margret Keuper

机构 * University of Mannheim(曼海姆大学) CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 多模态评测 :multi-modal(title);分类 cs.AI

Comments Accepted at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16174 2024-12-24 cs.CL econ.GN q-fin.EC 74%

Experimenting with Multi-modal Information to Predict Success of Indian IPOs

Sohom Ghosh, Arnab Maji, N Harsha Vardhan, Sudip Kumar Naskar

专题命中 多模态评测 :multi-modal(title);分类 cs.CL

Comments Dataset: https://huggingface.co/datasets/sohomghosh/Indian_IPO_datasets Codes: https://github.com/sohomghosh/Indian_IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14796 2024-12-24 cs.LG cs.AI 74%

MU-Bench: A Multitask Multimodal Benchmark for Machine Unlearning

Jiali Cheng, Hadi Amiri

专题命中 多模态评测 :multimodal(title);分类 cs.AI

Comments SafeGenAI @ NeurIPS 2024. Project page: https://clu-uml.github.io/MU-Bench-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11522 2024-12-03 cs.CV 74%

FIRE: A Dataset for Feedback Integration and Refinement Evaluation of Multimodal Models

Pengxiang Li, Zhi Gao, Bofei Zhang, Tao Yuan, Yuwei Wu, Mehrtash Harandi, Yunde Jia, Song-Chun Zhu, Qing Li

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments NeurIPS 2024 Dataset & Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17282 2024-11-27 cs.CC cs.AI 74%

Social Distancing Induced Coronavirus Optimization Algorithm (COVO): Application to Multimodal Function Optimization and Noise Removal

Om Ramakisan Varma, Mala Kalra

专题命中 多模态评测 :multimodal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15477 2024-11-26 cs.CV eess.IV 74%

MagicBathyNet: A Multimodal Remote Sensing Dataset for Bathymetry Prediction and Pixel-based Classification in Shallow Waters

Panagiotis Agrafiotis, Łukasz Janowski, Dimitrios Skarlatos, Begüm Demir

专题命中 多模态评测 :multimodal(title);分类 cs.CV

Comments 5 pages, 3 figures, 5 tables. Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2024

Journal ref IGARSS 2024 - 2024 IEEE International Geoscience and Remote Sensing Symposium, Athens, Greece, 2024, pp. 249-253

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13855 2024-11-22 eess.IV cs.CV cs.LG 74%

A Multimodal Approach to The Detection and Classification of Skin Diseases

Allen Yang, Edward Yang

专题命中 多模态评测 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏