arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9204 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9204 篇

2603.13362 2026-03-17 cs.SD cs.AI eess.AS 76%

Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings

多站点听诊录音的患者级多模态问答

Fan Wu, Tsai-Ning Wang, Nicolas Zumarraga, Ning Wang, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Oliver Aalami, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(伦理学院系统实验室,苏黎世联邦理工学院) Eindhoven University of Technology(埃因霍温理工大学) Centre for Digital Health Interventions, ETH Zurich(数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(数字健康干预中心,圣加尔登大学) Stanford Mussallem Center for Biodesign, Stanford University(斯坦福穆萨勒姆生物设计中心,斯坦福大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI、eess.AS

AI总结 本文提出通过门控交叉注意力将多站点听诊录音与冻结的大语言模型嵌入空间对齐,实现患者级评估,在CaReSound基准上取得SOTA结果,展示轻量领域特定编码器与多站点聚合的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02748 2026-03-10 cs.CV cs.AI 76%

iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding

iGVLM:动态指令引导的视觉编码用于问题感知的多模态理解

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Technology, Huazhong University of Science(科技,华中科技大学) Li Auto Inc.(Li汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究所,中国科学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 iGVLM通过动态指令引导的视觉编码框架,提升多模态理解中对指令的敏感度,实现从通用感知到任务感知推理的平滑过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17191 2026-01-27 cs.CV cs.CL 76%

VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery

VaseVQA: 古代希腊陶器的多模态代理与基准

Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao

机构 * University of Adelaide(阿德莱德大学) University of Liverpool(利物浦大学) University of Technology Sydney(悉尼技术大学) The Australian National University(澳大利亚国立大学) La Trobe University(拉特罗布大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16811 2026-01-26 cs.CV cs.AI 76%

Incorporating Eye-Tracking Signals Into Multimodal Deep Visual Models For Predicting User Aesthetic Experience In Residential Interiors

将眼动信号纳入多模态深度视觉模型以预测住宅内部空间的用户审美体验

Chen-Ying Chien, Po-Chih Kuo

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本研究提出双分支CNN-LSTM模型,融合眼动信号与视觉数据,提升对住宅室内空间审美体验的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14055 2026-01-21 cs.CV cs.AI 76%

Decoder-Free Supervoxel GNN for Accurate Brain-Tumor Localization in Multi-Modal MRI

无解码器的监督超像素图神经网络用于多模态MRI中脑肿瘤的准确定位

Andrea Protani, Marc Molina Van Den Bosch, Lorenzo Giusti, Heloisa Barbosa Da Silva, Paolo Cacace, Albert Sund Aillet, Miguel Angel Gonzalez Ballester, Friedhelm Hummel, Luigi Serio

机构 * European Organization for Nuclear Research, Geneva, Switzerland(欧洲核子研究中心) Dept. of Neuroscience, École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(瑞士洛桑联邦理工学院神经科学系) BCN Medtech, Dept. of Engineering, Universitat Pompeu Fabra, Barcelona, Spain(巴塞罗那大学工程系) Universidade de Coimbra, Coimbra, Portugal(科英布拉大学) Sapienza Università di Roma, Rome, Italy(罗马萨皮恩扎大学) ICREA, Barcelona, Spain(巴塞罗那高等科研机构)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出SVGFormer,一种无解码器的监督超像素图神经网络,用于多模态MRI中脑肿瘤的准确定位,通过层次编码器结合Transformer和图注意力网络,实现高精度和可解释的医学图像分析。

Comments 10 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09251 2025-12-11 cs.CV cs.AI 76%

GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model

GLACIA:基于多模态大语言模型的冰湖分割实例感知位置推理

Lalit Maurya, Saurabh Kaushik, Beth Tellman

机构 * Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(普森大学计算学院) Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(威斯康星大学麦迪逊分校可持续性与全球环境中心)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 GLACIA通过多模态大语言模型实现冰湖分割的实例感知位置推理,提升分割精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27033 2025-11-03 cs.RO cs.AI cs.CV 76%

A Multi-Modal Neuro-Symbolic Approach for Spatial Reasoning-Based Visual Grounding in Robotics

Simindokht Jahangard, Mehrzad Mohammadi, Abhinav Dhall, Hamid Rezatofighi

机构 * Faculty of Information Technology, Monash University(信息技术学院,墨尔本大学) Department of Electrical Engineering, Sharif University of Technology(电气工程系,谢赫大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23325 2025-10-28 cs.CV cs.AI cs.LG 76%

Multitask Multimodal Self-Supervised Learning for Medical Images

Cristian Simionescu

机构 * Department of Computer Science(计算机科学系) "Alexandru Ioan Cuza" University(阿莱克桑德鲁·伊奥安·库扎大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12230 2025-10-07 cs.CV cs.AI cs.RO 76%

LIAM: Multimodal Transformer for Language Instructions, Images, Actions and Semantic Maps

Yihao Wang, Raphael Memmesheimer, Sven Behnke

机构 * Autonomous Intelligent Systems, Computer Science Institute VI, Center for Robotics, University of Bonn, Germany(自主智能系统,计算机科学研究所第六研究所,机器人中心,波恩大学,德国)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

Comments 12 pages, 4 figures, 2 tables, 19th International Conference on Intelligent Autonomous Systems (IAS), Genoa, Italy, June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19993 2025-09-26 cs.CL cs.AI cs.HC 76%

MathBuddy: A Multimodal System for Affective Math Tutoring

Debanjana Kar, Leopold Böss, Dacia Braca, Sebastian Maximilian Dennerlein, Nina Christine Hubig, Philipp Wintersberger, Yufang Hou

机构 * IT:U Interdisciplinary Transformation University Austria(奥地利 interdisciplinary Transformation 大学) IBM Research India(印度 IBM 研究院)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 (Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11136 2025-09-16 cs.LG cs.AI cs.CL cs.SI 76%

Agentic Username Suggestion and Multimodal Gender Detection in Online Platforms: Introducing the PNGT-26K Dataset

Farbod Bijary, Mohsen Ebadpour, Amirhosein Tajbakhsh

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) Iran University of Science & Technology(伊朗科学技术大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09722 2025-09-15 cs.CV cs.CL cs.LG 76%

Improving MLLM Historical Record Extraction with Test-Time Image

Taylor Archibald, Tony Martinez

机构 * Brigham Young University

专题命中 多模态评测 :MLLM(title);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16193 2025-09-09 cs.CV cs.MM 76%

LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs

Zitong Xu, Huiyu Duan, Bingnan Liu, Guangji Ma, Jiarui Wang, Liu Yang, Shiqi Gao, Xiaoyu Wang, Jia Wang, Xiongkuo Min, Guangtao Zhai, Weisi Lin

机构 * Institute of Image Communication and Network Engineering, Shanghai JiaoTong University(上海交通大学图像通信与网络工程研究所) University of Electronic and Science Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04502 2025-09-08 cs.CL cs.AI 76%

VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples

Qixin Sun, Ziqin Wang, Hengyuan Zhao, Yilin Li, Kaiyou Song, Linjiang Huang, Xiaolin Hu, Qingpei Guo, Si Liu

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09966 2025-08-14 cs.CV cs.AI 76%

January Food Benchmark (JFB): A Public Benchmark Dataset and Evaluation Suite for Multimodal Food Analysis

Amir Hosseinian, Ashkan Dehghani Zahedani, Umer Mansoor, Noosheen Hashemi, Mark Woodward

机构 * January AI

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18148 2025-08-06 cs.CL cs.AI cs.LG 76%

NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous Scripts

Muhammad Farid Adilazuarda, Musa Izzanardi Wijanarko, Lucky Susanto, Khumaisa Nur'aini, Derry Wijaya, Alham Fikri Aji

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18424 2025-07-16 cs.AI cs.CL 76%

LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating

Chao Deng, Jiale Yuan, Pi Bu, Peijie Wang, Zhong-Zhi Li, Jian Xu, Xiao-Hui Li, Yuan Gao, Jun Song, Bo Zheng, Cheng-Lin Liu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Zhongguancun Academy, Beijing(中关村学院,北京)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01590 2025-07-03 cs.CV cs.AI cs.LG 76%

Autonomous AI Surveillance: Multimodal Deep Learning for Cognitive and Behavioral Monitoring

Ameer Hamza, Zuhaib Hussain But, Umar Arif, Samiya, M. Abdullah Asad, Muhammad Naeem

机构 * Department of BS Data Science, Gift University, Gujranwala, Pakistan(数据科学系,Gift大学,巴基斯坦)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13498 2025-05-21 cs.CL cs.AI 76%

IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation

Khanh-Tung Tran, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork(科尔克大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04526 2025-05-16 cs.CL cs.AI 76%

FAMMA: A Benchmark for Financial Domain Multilingual Multimodal Question Answering

Siqiao Xue, Xiaojing Li, Fan Zhou, Qingyang Dai, Zhixuan Chu, Hongyuan Mei

机构 * Alipay(支付宝) Zhejiang University(浙江大学) TTIC Purdue University(普渡大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09366 2025-04-28 cs.CV cs.MM 76%

MHAD: Multimodal Home Activity Dataset with Multi-Angle Videos and Synchronized Physiological Signals

Lei Yu, Jintao Fei, Xinyi Liu, Yang Yao, Jun Zhao, Guoxin Wang, Xin Li

机构 * JD Health, Beijing, China(京东健康,北京,中国) School of Software Engineering, Huazhong University of Science and Technology, Wuhan, China(华中科技大学软件工程学院,武汉,中国) College of Biomedical Engineering and Instrument Science, Zhejiang University, Hangzhou, China(浙江大学生物医学工程与仪器科学学院,杭州,中国)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07032 2025-03-11 cs.CL cs.CV 76%

Multimodal Human-AI Synergy for Medical Imaging Quality Control: A Hybrid Intelligence Framework with Adaptive Dataset Curation and Closed-Loop Evaluation

Zhi Qin, Qianhui Gui, Mouxiao Bian, Rui Wang, Hong Ge, Dandan Yao, Ziying Sun, Yuan Zhao, Yu Zhang, Hui Shi, Dongdong Wang, Chenxin Song, Shenghong Ju, Lihao Liu, Junjun He, Jie Xu, Yuan-Cheng Wang

机构 * Zhongda Hospital(中大医院) School of Medicine, Southeast University(东南大学医学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09927 2025-02-17 cs.CV cs.AI 76%

Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence

Granite Vision Team, Leonid Karlinsky, Assaf Arbelle, Abraham Daniels, Ahmed Nassar, Amit Alfassi, Bo Wu, Eli Schwartz, Dhiraj Joshi, Jovana Kondic, Nimrod Shabtay, Pengyuan Li, Roei Herzig, Shafiq Abedin, Shaked Perek, Sivan Harary, Udi Barzelay, Adi Raz Goldfarb, Aude Oliva, Ben Wieles, Bishwaranjan Bhattacharjee, Brandon Huang, Christoph Auer, Dan Gutfreund, David Beymer, David Wood, Hilde Kuehne, Jacob Hansen, Joseph Shtok, Ken Wong, Luis Angel Bathen, Mayank Mishra, Maksym Lysak, Michele Dolfi, Mikhail Yurochkin, Nikolaos Livathinos, Nimrod Harel, Ophir Azulai, Oshri Naparstek, Rafael Teixeira de Lima, Rameswar Panda, Sivan Doveh, Shubham Gupta, Subhro Das, Syed Zawad, Yusik Kim, Zexue He, Alexander Brooks, Gabe Goodhart, Anita Govindjee, Derek Leist, Ibrahim Ibrahim, Aya Soffer, David Cox, Kate Soule, Luis Lastras, Nirmit Desai, Shila Ofek-koifman, Sriram Raghavan, Tanveer Syeda-Mahmood, Peter Staar, Tal Drory, Rogerio Feris

机构 * IBM Research(IBM研究院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12814 2025-02-06 cs.LG cs.CL cs.CR cs.CV 76%

Dissecting Adversarial Robustness of Multimodal LM Agents

Chen Henry Wu, Rishi Shah, Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

Comments ICLR 2025. Also oral at NeurIPS 2024 Open-World Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09312 2025-01-07 cs.CV cs.AI cs.LG 76%

Towards Multi-Modal Animal Pose Estimation: A Survey and In-Depth Analysis

Qianyi Deng, Oishi Deb, Amir Patel, Christian Rupprecht, Philip Torr, Niki Trigoni, Andrew Markham

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

Comments 35 pages, 5 figures, 8 tables. Qianyi Deng and Oishi Deb are Joint Major Contributors to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18297 2024-09-30 cs.RO cs.AI cs.CV 76%

Flat'n'Fold: A Diverse Multi-Modal Dataset for Garment Perception and Manipulation

Lipeng Zhuang, Shiyu Fan, Yingdong Ru, Florent Audonnet, Paul Henderson, Gerardo Aragon-Camarasa

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02489 2024-09-17 cs.SD cs.AI eess.AS 76%

NeuroSpex: Neuro-Guided Speaker Extraction with Cross-Modal Attention

Dashanka De Silva, Siqi Cai, Saurav Pahuja, Tanja Schultz, Haizhou Li

专题命中 多模态评测 :cross-modal(title);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01514 2024-09-04 cs.CV cs.AI cs.LG 76%

From Data to Insights: A Covariate Analysis of the IARPA BRIAR Dataset for Multimodal Biometric Recognition Algorithms at Altitude and Range

David S. Bolme, Deniz Aykac, Ryan Shivers, Joel Brogan, Nell Barber, Bob Zhang, Laura Davies, David Cornett

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09209 2024-07-19 cs.CL eess.AS 76%

Pronunciation Assessment with Multi-modal Large Language Models

Kaiqi Fu, Linkai Peng, Nan Yang, Shuran Zhou

专题命中 多模态评测 :multi-modal(title);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16578 2024-05-31 cs.CV cs.AI 76%

SegICL: A Multimodal In-context Learning Framework for Enhanced Segmentation in Medical Imaging

Lingdong Shen, Fangxin Shang, Xiaoshuang Huang, Yehui Yang, Haifeng Huang, Shiming Xiang

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏