arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2603.24294 2026-03-26 cs.CV 79%

VERIA: Verification-Centric Multimodal Instance Augmentation for Long-Tailed 3D Object Detection

VERIA:面向长尾3D目标检测的验证导向多模态实例增强

Jumin Lee, Siyeong Lee, Namil Kim, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院) Naver Labs(Naver实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 VERIA通过多模态实例增强方法提升长尾分布下3D目标检测性能,利用基础模型生成同步RGB-LiDAR实例并进行语义与几何验证,改进稀有类别的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24059 2026-03-26 cs.CV 79%

AD-Reasoning: Multimodal Guideline-Guided Reasoning for Alzheimer's Disease Diagnosis

AD-Reasoning:多模态指南引导推理用于阿尔茨海默病诊断

Qiuhui Chen, Yushan Deng, Xuancheng Yao, Yi Hong

机构 * School of Information Science and Engineering(信息科学与工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AD-Reasoning框架,结合结构MRI和六种临床模态,生成符合NIA-AA标准的诊断,通过强化学习提升透明度和指南一致性。

Comments ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23229 2026-03-25 cs.CL 79%

I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes

我来了,我看到了,我解释了:在表情包中评估多模态大语言模型的隐喻意义

Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) National Research Council Canada(加拿大国家研究委员会)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文评估了八种最先进的生成式多模态大语言模型在检测和解释六种隐喻意义类型上的能力,并通过人工评估验证其解释的合理性与忠实性。

Comments LREC 2026, 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22763 2026-03-25 cs.CV 79%

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22756 2026-03-25 cs.CV 79%

MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding

MVPBench: 一个多视频感知评估基准用于多模态视频理解

Purui Bai, Tao Wu, Jiayang Sun, Xinyue Liu, Huaibo Huang, Ran He

机构 * MAIS \& NLPR, Institute of Automation Chinese Academy of Sciences Beijing, China SIST ShanghaiTech University Shanghai, China

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 MVPBench通过14个跨多样本域的子任务评估模型从视频序列中提取相关信息的能力,揭示当前模型在多视频处理上的局限性。

Comments 15 pages, 7 figures, accepted by IJCNN 2026, code and dataset available at https://github.com/MVPBench/MVPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04406 2026-03-25 cs.IR cs.AI cs.IT cs.LG cs.SI math.IT 79%

Training-free Adjustable Polynomial Graph Filtering for Ultra-fast Multimodal Recommendation

无需训练的可调多项式图过滤器用于超快多模态推荐

Yu-Seung Roh, Joo-Young Kim, Jin-Duk Park, Won-Yong Shin

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) NAVER Corporations(NAVER公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出无需训练的多模态推荐方法,通过构建相似性图并利用多项式图滤波器融合多模态信号,提升推荐准确率并降低计算成本。

Comments 21 pages, 9 figures, 7 tables; published in the Engineering Applications of Artificial Intelligence (Please cite our journal version.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21700 2026-03-24 cs.CV 79%

PPGL-Swarm: Integrated Multimodal Risk Stratification and Hereditary Syndrome Detection in Pheochromocytoma and Paraganglioma

PPGL-Swarm:集成多模态风险分层与遗传综合征检测的pheochromocytoma和paraganglioma诊断系统

Zelin Liu, Xiangfu Yu, Jie Huang, Ge Wang, Yizhe Yuan, Zhenyu Yi, Jing Xie, Haotian Jiang, Lichi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Ruijin Hospital(瑞金医院) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PPGL-Swarm系统,通过多模态证据整合实现全面诊断报告,包括自动化GAPP评分、基因风险警报及可追溯的推理路径,解决传统诊断方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21245 2026-03-24 cs.CV 79%

CornOrb: A Multimodal Dataset of Orbscan Corneal Topography and Clinical Annotations for Keratoconus Detection

CornOrb:用于角膜变性检测的多模态数据集

Mohammed El Amine Lazouni, Leila Ryma Lazouni, Zineb Aziza Elaouaber, Mohammed Ammar, Sofiane Zehar, Mohammed Youcef Bouayad Agha, Ahmed Lazouni, Amel Feroui, Ali H. Al-Timemy, Siamak Yousefi, Mostafa El Habib Daho

机构 * Biomedical Engineering Laboratory(生物医学工程实验室) Abou Bakr Belkaid University(阿布·巴克·贝卡伊大学) LIST Laboratory(LIST实验室) M’Hamed Bougara Boumerdes University(穆哈梅德·布加拉 Boumerdes 大学) Lazouni Clinic(拉祖尼诊所) University of Western Brittany LaTIM UMR1101(西 Brittany 大学 LaTIM UMR1101) Inserm Brest(里尔 Brest 研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 CornOrb数据集包含744名患者1454只眼的多模态数据,包括889只正常眼和565例角膜变性病例,提供四类角膜图谱及结构化表格数据,用于支持AI驱动的角膜变性检测与分析。

Comments Preprint, 9 pages, 4 figures, dataset paper. Corresponding author: mostafa.elhabibdaho@univ-brest.fr

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV 79%

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20442 2026-03-24 cs.LG cs.AI 79%

Detecting Neurovascular Instability from Multimodal Physiological Signals Using Wearable-Compatible Edge AI: A Responsible Computational Framework

通过可穿戴设备的边缘AI检测神经血管不稳定性:一种负责任的计算框架

Truong Quynh Hoa, Hoang Dinh Cuong, Truong Xuan Khanh

机构 * H&K Research Studio, Clevix LLC(H&K研究室,Clevix LLC) Department of Cardiology, Hanoi Heart Hospital(心血管科,河内心脏医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Melaguard框架,通过融合多种生理信号检测神经血管不稳定性,优于单一模态设备,通过三阶段验证提升检测性能。

Comments 11 pages, 8 figures, 6 tables. Submitted to IEEE JBHI. Code: https://github.com/ClevixLab/Melaguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16753 2026-03-24 cs.CL 79%

GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs

GAICo:一个用于评估多样化和多模态生成式人工智能输出的部署和可扩展框架

Nitin Gupta, Pallav Koppisetti, Kausik Lakkaraju, Biplav Srivastava

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 GAICo提供统一框架,支持多种参考指标,用于评估生成式AI输出,提升评估标准化和可复现性,加速AI系统开发。

Comments 11 pages, 7 figures; accepted at IAAI/AAAI 2026; (updated) extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20148 2026-03-23 cs.CV 79%

Can Large Multimodal Models Inspect Buildings? A Hierarchical Benchmark for Structural Pathology Reasoning

大型多模态模型能否检查建筑?一种用于结构病理推理的分层基准

Hui Zhong, Yichun Gao, Luyan Liu, Hai Yang, Wang Wang, Haowei Zhang, Xinhu Zheng

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DefectBench基准,评估大型多模态模型在建筑表面检测中的能力,发现其在拓扑理解和语义理解方面表现优异,但在精确定位方面存在不足,并验证了零样本生成分割的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19688 2026-03-23 cs.CL 79%

DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs

DataProphet:解开多模态大语言模型监督数据泛化之谜

Xuan Qi, Luxi He, Dan Roth, Xingyu Fu

机构 * University of Pennsylvania(宾夕法尼亚大学) Tsinghua University(清华大学) Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出DataProphet,一种无需训练的指标,通过结合多模态困惑度、相似性和数据多样性,有效评估监督数据对目标基准的影响,实现更优的数据选择。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05751 2026-03-20 cs.CV 79%

SenseShift6D: Multimodal RGB-D Benchmarking for Robust 6D Pose Estimation across Environment and Sensor Variations

SenseShift6D:多模态RGB-D基准测试用于在环境和传感器变化下的鲁棒6D位姿估计

Yegyu Han, Taegyoon Yoon, Dayeon Woo, Sojeong Kim, Hyung-Sin Kim

机构 * Graduate School of Data Science(数据科学研究生院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SenseShift6D通过多样的光照和传感器设置,评估了6D位姿估计在真实环境中的鲁棒性,揭示了传感器和环境变化对性能的影响,推动了多模态传感器选择的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17993 2026-03-19 cs.CV cs.RO 79%

GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes

GMT:用于3D场景中6自由度物体轨迹合成的目标条件多模态Transformer

Huajian Zeng, Abhishek Saroha, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆桑大学人工智能研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GMT,一种多模态Transformer框架,通过结合3D边界框几何、点云上下文、语义物体类别和目标末端姿态,生成真实且目标导向的物体轨迹,提升了空间精度和方向控制。

Comments Accpeted by 3DV 2026. Project Page: https://huajian-zeng.github.io/projects/gmt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17304 2026-03-19 cs.CV 79%

3D MRI-Based Alzheimer's Disease Classification Using Multi-Modal 3D CNN with Leakage-Aware Subject-Level Evaluation

基于3D MRI的阿尔茨海默病分类:使用多模态3D CNN与泄漏感知的受试者级评估

Md Sifat, Sania Akter, Akif Islam, Md. Ekramul Hamid, Abu Saleh Musa Miah, Najmul Hassan, Md Abdur Rahim, Jungpil Shin

机构 * University of Rajshahi(拉贾斯坦大学) University of Aizu(御所大学) Pabna University of Science(帕布纳科学大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态3D卷积神经网络,利用原始OASIS 1 MRI体积进行阿尔茨海默病分类,通过受试者级交叉验证实现72.34%的准确率和0.7781的ROC AUC,验证了体积分析在疾病分类中的有效性。

Comments 5 tables, 6 figures, Submitted to International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11896 2026-03-19 cs.CV 79%

Digital FAST: An AI-Driven Multimodal Framework for Rapid and Early Stroke Screening

数字FAST:一种基于AI的多模态框架,用于快速和早期中风筛查

Ngoc-Khai Hoang, Thi-Nhu-Mai Nguyen, Huy-Hieu Pham

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种快速非侵入式多模态深度学习框架,用于基于F.A.S.T.评估数据的自动二分类中风筛查,通过融合面部表情、语音信号和上半身运动信息提升诊断鲁棒性,实验表明模型在准确率和F1分数上均优于单模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25620 2026-03-19 cs.CV 79%

LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology

LMOD+: 一个全面的多模态数据集和基准,用于开发和评估眼科中的多模态大语言模型

Zhenyue Qin, Yang Liu, Yu Yin, Jinyu Ding, Haoran Zhang, Anran Li, Dylan Campbell, Xuansheng Wu, Ke Zou, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih Chung Tham, Ninghao Liu, Xiuzhen Zhang, Qingyu Chen

机构 * School of Medicine, Yale University(耶鲁大学医学院) School of Computing, Australian National University(澳大利亚国立大学计算机学院) School of Engineering, Imperial College London(伦敦帝国理工学院工程学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨秀隆医学学院) National Eye Institute, National Institutes of Health(美国国立卫生研究院眼科研究所) National Library of Medicine, National Institutes of Health(美国国立卫生研究院国家医学图书馆) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算机技术学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一个包含32633个实例的多模态眼科基准数据集,涵盖12种常见眼科疾病和5种成像模态,通过扩展数据集、扩展任务覆盖和系统评估24种最先进的MLLMs,推动眼科AI应用发展。

Comments ACM Transactions on Computing for Healthcare

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18694 2026-03-19 cs.RO cs.AI cs.SY eess.SY 79%

AgriChrono: A Multi-modal Dataset Capturing Crop Growth and Lighting Variability with a Field Robot

AgriChrono:一种捕捉作物生长和光照变化的多模态数据集

Jaehwan Jeong, Tuan-Anh Vu, Mohammad Jony, Shahab Ahmad, Md. Mukhlesur Rahman, Sangpil Kim, M. Khalid Jawed

机构 * Korea University(韩国大学) University of California, Los Angeles(加州大学洛杉矶分校) North Dakota State University(北达科他州立大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出AgriChrono数据集,通过多传感器平台采集农田动态变化数据,验证了高精度动态非刚性场景重建的挑战,推动农业机器人研究。

Comments Keywords: Agricultural Robotics, In-the-wild Dataset, 3D Reconstruction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16463 2026-03-18 cs.AI cs.HC 79%

Follow the Clues, Frame the Truth: Hybrid-evidential Deductive Reasoning in Open-Vocabulary Multimodal Emotion Recognition

循证推断,还原真相:面向开放词汇多模态情感识别的混合证据推理

Yu Liu, Lei Zhang, Haoxun Li, Hanlei Shi, Yuxuan Ding, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(杭州高等研究 institute,中国科学院大学,杭州,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HyDRA架构,通过混合证据推理解决多模态情感识别中的歧义问题,通过强化学习优化推理过程,提升在复杂场景下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16181 2026-03-18 cs.CV cs.CR 79%

KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety

KidsNanny:一种集成视觉分类、目标检测、OCR和上下文推理的双阶段多模态内容审查流水线,用于儿童安全

Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel

机构 * KidsNanny Research Team, Vartit Technology Inc.(KidsNanny研究团队,Vartit技术公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出KidsNanny,一种双阶段多模态内容审查架构,通过视觉Transformer和目标检测器进行视觉筛查,结合OCR和基于文本的7B语言模型进行上下文推理,以提高儿童安全的内容审查效率和准确性。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15939 2026-03-18 cs.LG cs.AI 79%

Data-Local Autonomous LLM-Guided Neural Architecture Search for Multiclass Multimodal Time-Series Classification

数据本地自主LLM引导的神经架构搜索用于多类多模态时间序列分类

Emil Hardarson, Luka Biedebach, Ómar Bessi Ómarsson, Teitur Hrólfsson, Anna Sigridur Islind, María Óskarsdóttir

机构 * University of Southampton(南安普顿大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种数据本地的LLM引导神经架构搜索框架,用于多类多模态时间序列分类,通过轻量级融合MLP和专家架构联合搜索提升模型性能,减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13693 2026-03-18 cs.CV 79%

A WDLoRA-Based Multimodal Generative Framework for Clinically Guided Corneal Confocal Microscopy Image Synthesis in Diabetic Neuropathy

基于WDLoRA的多模态生成框架用于临床指导的糖尿病性周围神经病变角膜共聚焦显微镜图像合成

Xin Zhang, Liangxiu Han, Tam Sobeih, Yue Shi, Yalin Zheng, Uazman Alam, Maryam Ferdousi, Rayaz Malik

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科学与视觉科学系) Faculty of Biology, Medicine and Health, University of Manchester(曼彻斯特大学生物、医学与健康学院) Department of Medicine, Weill Cornell Medicine-Qatar(韦尔·柯尔曼医学中心-卡塔尔医学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于WDLoRA的多模态生成框架,用于生成糖尿病性周围神经病变的角膜共聚焦显微镜图像,通过结合神经分割掩膜和疾病特异性临床提示,提升图像合成的解剖学一致性与临床诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07985 2026-03-18 cs.CL 79%

Multilingual, Multimodal Pipeline for Creating Authentic and Structured Fact-Checked Claim Dataset

多语言、多模态流水线用于创建真实且结构化的事实核查数据集

Z. Melce Hüsünbeyi, Virginie Mouilleron, Leonie Uhling, Daniel Foppe, Tatjana Scheffler, Djamé Seddah

机构 * Ruhr-Universität Bochum(博尔塔尔大学波恩)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出一个多语言、多模态的数据收集与处理流水线,通过整合ClaimReview feeds、抓取完整驳斥文章、标准化异构声明裁定并添加结构化元数据和对齐的视觉内容,构建了法语和德语的事实核查数据集,提升了事实核查的可解释性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24741 2026-03-17 cs.CV 79%

Collaborating Vision, Depth, and Thermal Signals for Multi-Modal Tracking: Dataset and Algorithm

融合视觉、深度和热信号的多模态跟踪:数据集与算法

Xue-Feng Zhu, Tianyang Xu, Yifan Pan, Jinjie Gu, Xi Li, Jiwen Lu, Xiao-Jun Wu, Josef Kittler

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态跟踪任务,结合RGB、深度和热红外信号,构建RGBDT500数据集,并提出RDTTrack算法,通过融合三模态信息提升复杂场景下的跟踪鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14229 2026-03-17 cs.AI cs.SE 79%

Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data Lakes

基于代理的DAG编排规划框架:用于混合数据湖中多模态、多跳问答系统

Kirushikesh D B, Manish Kesarwani, Nishtha Madaan, Sameep Mehta, Aldrin Dennis, Siddarth Ajay, Rakesh B R, Renu Rajagopal, Sudheesh Kairali

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出A.DOT规划框架,通过编译自然语言查询为DAG执行计划,实现多模态多跳问答,提升准确性和效率,并生成可追溯的证据链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00744 2026-03-17 cs.CV 79%

Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs

先定位后回答:一种用于基于地面的医学多模态大语言模型的幻觉评估基准

Dung Nguyen, Minh Khoi Ho, Huy Ta, Thanh Tam Nguyen, Qi Chen, Kumar Rav, Quy Duong Dang, Satwik Ramchandre, Son Lam Phung, Zhibin Liao, Minh-Son To, Johan Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出HEAL-MedVQA基准,通过创新评估协议和67K VQA数据集,评估医学多模态模型的定位能力与幻觉鲁棒性,提出LobA框架提升视觉推理能力,实验结果表明其在挑战性基准中优于现有生物医学LMMs。

Comments Accepted at Joint Conference on Artificial Intelligence (IJCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12690 2026-03-16 cs.CV 79%

CM-Bench: A Comprehensive Cross-Modal Feature Matching Benchmark Bridging Visible and Infrared Images

CM-Bench:一个综合的跨模态特征匹配基准,连接可见图像和红外图像

Liangzheng Sun, Mengfan He, Xingyu Shao, Binbin Li, Zhiqiang Yan, Chunyu Li, Ziyang Meng, Fei Xing

机构 * School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出CM-Bench,涵盖30种跨模态特征匹配算法,用于评估同源性估计、相对姿态估计和基于特征匹配的地理定位,包含自适应预处理和新的红外-卫星跨模态数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21662 2026-03-16 cs.CV 79%

Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following

多标准:在多元标准下评估多模态裁判

Tianyi Xiong, Yi Ge, Ming Li, Zuolong Zhang, Pranav Kulkarni, Kaishen Wang, Qi He, Zeying Zhu, Chenxi Liu, Ruibo Chen, Tong Zheng, Yanshuo Chen, Xiyao Wang, Renrui Zhang, Wenhu Chen, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Waterloo(滑铁卢大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11924 2026-03-13 cs.LG cs.CL 79%

Chem4DLLM: 4D Multimodal LLMs for Chemical Dynamics Understanding

Chem4DLLM: 4D 多模态大语言模型用于化学动态理解

Xinyu Li, Zhen Zhang, Qi Chen, Anton van den Hengel, Lina Yao, Javen Qinfeng Shi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 Chem4DLLM通过整合等变图编码器和预训练大语言模型,旨在提升对4D分子动态轨迹的解释能力,推动化学动态理解和多模态科学推理的研究。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏