arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2606.02956 2026-06-03 cs.CV cs.LG cs.RO 79%

The Road Ahead in Autonomous Driving: The KITScenes Multimodal Dataset

自动驾驶的未来之路:KITScenes多模态数据集

Richard Schwarzkopf, Fabian Immel, Alexander Blumberg, Jonas Merkert, Nils Rack, Kaiwen Wang, Fabian Konstantinidis, Julian Truetsch, Carlos Fernandez, Annika Bätz, Kevin Rösch, Marlon Steiner, Willi Poh, Yinzhe Shen, Royden Wagner, Felix Hauser, Dominik Strutz, Jaime Villa, Gleb Stepanov, Holger Caesar, Ömer Şahin Taş, Frank Bieder, Jan-Hendrik Pauls, Christoph Stiller

机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University Charles III of Madrid(马德里第三大学) Delft University of Technology(代尔夫特理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出KITScenes多模态数据集,通过高保真传感器和完整HD地图,解决现有数据集在传感器精度、地图完整性和地理多样性上的不足,并引入四个基准推动空间学习。

Comments 28 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01237 2026-06-02 cs.AI 79%

Brain-Atlas-Guided Generative Counterfactual Attention for Explainable Cognitive Decline Diagnosis Using Multimodal Connectomes

脑图谱引导的生成式反事实注意力用于基于多模态连接组的可解释认知衰退诊断

Xiongri Shen, Jiaqi Wang, Zhenxi Song, Yi Zhong, Leilei Zhao, Xin He, Baiying Lei, Zhiguo Zhang

机构 * Department of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术系) School of Intelligence Science and Engineering, College of Artificial Intelligence, Harbin Institute of Technology(哈尔滨工业大学智能科学与工程学院) School of Biomedical Engineering, National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, Guangdong Key Laboratory for Biomedical, Measurements and Ultrasound Imaging, Shenzhen University Medical School, Shenzhen University(深圳大学医学院生物医学工程学院、医学超声关键技术工程实验室、广东省生物医学测量与超声成像重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一种脑图谱知识引导的生成式反事实注意力网络(GCAN),通过将诊断建模为源到目标的反事实生成问题,利用多模态连接组实现可解释的认知衰退诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00928 2026-06-02 cs.CV cs.LG 79%

Single-Channel Tissue Segmentation via Cross-Modal Distillation from Foundation Models

基于基础模型跨模态蒸馏的单通道组织分割

Sakib Mohammad, Jarin Ritu, Md Sakhawat Hossain

机构 * Department of Engineering Technology(工程技术系) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Mechanical Engineering(机械工程系)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出跨模态知识蒸馏框架,将多通道输入的基础模型教师知识迁移到仅使用核通道的轻量级学生网络,实现单通道组织分割性能大幅提升。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00891 2026-06-02 cs.CV 79%

MMDG-Bench: A Benchmark for Multimodal Domain Generalization

MMDG-Bench:多模态领域泛化基准

Qianshan Zhan, Qian Wang, Da Li, Xiao-Jun Zeng, Xiatian Zhu

机构 * University of Manchester(曼彻斯特大学) Jiyue AI(极越AI) Samsung AI Centre Cambridge(三星AI中心剑桥) University of Surrey(萨里大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 提出MMDG-Bench基准,通过D2M和M2D两种框架统一多模态学习与领域泛化,在动作识别和活体检测等任务上验证了结构化组合优于现有方法,并给出关键设计指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00622 2026-06-02 cs.CV 79%

MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue

MM-Snowball:多模态多轮对话中的幻觉雪崩评估与缓解

Yue Jiang, Xue Jiang, Lihua Zhang, Zhiqiang Wang, Yuhang Lu, Peng Wang, Bo Han, Feng Zheng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Southern University of Science and Technology(南方科技大学) TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) MM Lab, CUHK(CUHK 多模态实验室) RAMS Lab, Huawei Technologies Co., Ltd.(华为技术有限公司 RAMS 实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态大模型在多轮对话中因初始错误累积导致幻觉雪崩的问题,提出首个细粒度诊断基准MM-Snowball,并设计无训练的冲突感知视觉校正方法CAVR,通过表示级刷新视觉锚定和logit级修正输出分布来缓解雪崩效应。

Comments Accepted by The International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31410 2026-06-01 cs.AI 79%

FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning

FAM-Bench:面向条件感知的“食物即药物”推理的多模态基准

Mingyang Mao, Bhargav Rishi Medisetti, Utkarsh Grover, Tanvir Ibrahim, Wenyan Li, Tingting Zhang, Xiaomin Lin

机构 * Department of Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) Muma College of Business, University of South Florida(佛罗里达州立大学Muma商学院) Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 提出FAM-Bench多模态基准,包含2500个营养专家验证的实例,通过菜肴适宜性评估和比较分析两个任务,测试模型在特定健康状况下对食物选择的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30900 2026-06-01 cs.AI physics.app-ph 79%

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动力学基准测试

Ben Wang, Xiaogang Li, Ruochen Gao, Peiyao Xiao, Chengliang Xu, Zeyu Wang, Zichao Chen, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出BilliardPhys-Bench基准,通过合成台球环境评估多模态大语言模型在物理推理(碰撞、反弹、最终位置预测)上的能力,发现模型存在“静态偏差”且性能随模拟时间与场景复杂度下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29833 2026-06-01 cs.AI 79%

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准

Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen, Xin Chen, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Southeast University(东南大学) Nanjing University(南京大学) Suzhou Laboratory(苏州实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30027 2026-05-29 cs.CV cs.IR 79%

DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark

DocRetriever:面向多模态文档检索的即插即用框架与综合基准

Ruofan Hu, Menghui Zhu, Jieming Zhu, Bo Chen, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Li Tang, Tao Jin, Zhou Zhao

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出DocRetriever即插即用框架,通过布局感知的稀疏嵌入和推理增强的重排序器解决多模态文档检索中语义模糊和泛化瓶颈问题,并构建MultiDocR基准实现更严格评估。

Comments Accepted at KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29579 2026-05-29 cs.CV 79%

ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation

ReactBench:通过系统评估的多模态幻觉因果驱动基准

Shizhe Zhou, Bohan Jia, Kai Wu, Yan Shen, Tongyun Li, Yuyang Wu, Shaohui Lin

机构 * East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出ReactBench基准,通过对抗性图像和诱导幻觉的查询,系统评估多模态大模型在关系擦除、反事实属性、变化追踪和密集计数等任务中的因果幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29339 2026-05-29 cs.CV 79%

DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

DMC-CF: 用于因果推理的动态多模态反事实QA基准

Junzhe Zhang, Huixuan Zhang, Guirong Wang, Xingyao Zhang, Pei Liu, Lin Qu, Hu Wei, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有因果推理数据集规模有限或基于非真实数据的问题,提出基于真实视频的大规模多模态因果反事实推理基准DMC-CF-Static,并利用动态图干预框架构建动态评估基准DMC-CF-Dynamic,实验表明当前多模态大模型在真实场景下的因果推理能力仍需大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26255 2026-05-29 eess.IV cs.AI cs.LG 79%

Prospective evaluation of multimodal respiratory failure prediction: Do chest X-rays improve performance beyond EHR signals?

多模式呼吸衰竭预测的前瞻性评估:胸部X光片能否在电子健康记录信号之外提升性能?

Xiaolei Lu, Shamim Nemati

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出一种门控多模态框架,集成结构化电子健康记录时间序列数据和胸部X光片基础模型表示,用于前瞻性预测ICU患者24小时内是否需要有创机械通气,结果显示相比仅使用电子健康记录的模型和医生预测,多模态融合提高了区分度、敏感性和阳性预测值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24399 2026-05-29 cs.AI 79%

ConceptM$^3$oE: Concept-Guided Multimodal Mixture of Experts for Interpretable Computational Pathology

ConceptM$^3$oE:面向可解释计算病理学的概念引导多模态专家混合模型

Xuan Wang, Zhongling Xu, Gopi Kannedhara, Joakim Nguyen, Jian Yu, Jinrui Fang, Abdurrahmaan Baghdadi, Tianlong Chen, Awais Naeem, Chandra Krishnan, Edward Castillo, Andrew H. Song, Ankita Shukla, Ying Ding, Nicholas Konz, Hairong Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Dell Children’s Medical Center(德尔儿童医疗中心) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) University of Nevada, Reno(内华达大学里诺分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出ConceptM$^3$oE框架,通过概念引导的多模态专家混合路径嵌入概念形成,并利用残差路径保持性能与可解释性,在脑肿瘤分类中优于基线并提升小样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06063 2026-05-29 cs.AI cs.IT cs.LG math.IT 79%

TelecomTS: A Multi-Modal Observability Dataset for Time Series and Language Analysis

TelecomTS:面向时间序列与语言分析的多模态可观测性数据集

Austin Feng, Andreas Varvarigos, Ioannis Panitsas, Daniela Fernandez, Jinbiao Wei, Yuwei Guo, Jialin Chen, Ali Maatouk, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出TelecomTS,一个来自5G电信网络的大规模多模态可观测性数据集,通过保留绝对尺度信息的异质协变量和多样化下游任务(异常检测、根因分析、多模态问答),揭示了现有模型在处理可观测性数据的高噪声、突变特性时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28161 2026-05-28 cs.CV 79%

MeniOmni: A Structured Multimodal Benchmark for Holistic Meniscus Injury Assessment

MeniOmni:用于整体半月板损伤评估的结构化多模态基准

Shurui Xu, Siqi Yang, Weiping Ding, Hui Wang, Mengzhen Fan, Yuyu Sun, Shuyan Li

机构 * 1School of Electronics, Electrical Engineering Computer Science, Queen's University Belfast, Belfast, UK 2Radiology Department, Affiliated Nantong Clinical College of Nantong University, Nantong First People's Hospital, School of Clinical Medicine, Nantong University, Nantong, Jiangsu, China 3School of Artificial Intelligence Computer Science, Nantong University, Nantong, China 4Faculty of Data Science, City University of Macau, Macau, China 5Department of Chemistry, University of Oxford, Oxford, UK 6Orthopedics Department, Nantong First People's Hospital, Southeast University, Nantong, Jiangsu, China

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出MeniOmni基准,包含多中心MRI、临床先验和专家标注文本,支持细粒度Stoller分级和诊断报告生成,并引入风险感知序数评估和语义一致性指标Meni-Score。

Comments Accepted by IEEE International Conference on Multimedia and Expo (ICME) 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12843 2026-05-28 cs.CV 79%

MMRad-22K: A Structured Multimodal Evidence Dataset for Chest X-ray Report Generation

MMRad-22K:用于胸部X光报告生成的结构化多模态证据数据集

Yichen Zhao, Zelin Peng, Fenghe Tang, Piao Yang, Yu Huang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能MOE实验室、人工智能研究院、计算机科学学院、上海交通大学) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China (USTC)(生物医学工程学院、生命科学与医学系、中国科学技术大学) Center for Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC(医学影像、机器人、分析计算与学习中心(MIRACLE)、苏州市先进研究院、中国科学技术大学) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(放射科、浙江大学医学院第一附属医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对胸部X光报告生成中现有资源监督信号碎片化的问题,提出结构化多模态证据数据集MMRad-22K,并基于统一LVLM骨干进行适配,证明结构化多模态证据优于纯文本或边界框证据,在语言和临床指标上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09658 2026-05-26 cs.CV 79%

Measuring Epistemic Humility in Multimodal Large Language Models

测量多模态大语言模型中的认知谦逊

Bingkui Tong, Jiaer Xia, Sifeng Shang, Kaiyang Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出HumbleBench基准,通过强制选择多项选择中引入“以上皆非”选项,评估多模态大语言模型拒绝错误选项的谦逊行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08945 2026-05-25 cs.AI 79%

FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation

FATHOMS-RAG:评估使用检索增强生成的多模态系统思考与观察的框架

Samuel Hildebrand, Curtis Taylor, Sean Oesch, James M Ghawaly, Amir Sadovnik, Ryan Shivers, Brandon Schreiber, Kevin Kurian

机构 * Louisiana State University(路易斯安那州立大学) Oak Ridge National Lab(橡树岭国家实验室) University of Florida(佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一个评估RAG管道的基准,包含93个多模态问题、短语级召回率指标、最近邻嵌入分类器,并对比开源与闭源管道性能,发现闭源管道在正确性和幻觉指标上显著优于开源。

Comments Accepted at SAFE-ML 2026 Workshop at the International Conference on Software Testing (ICST) 2026 Code: https://github.com/Sam-Hildebrand/FATHOMS-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22550 2026-05-22 cs.CV 79%

MOTOR: A Multimodal Dataset for Two-Wheeler Rider Behavior Understanding

MOTOR: 两轮车骑行行为理解的多模态数据集

Varun A. Paturkar, Shankar Gangisetty, C. V. Jawahar

机构 * CVIT, IIIT-Hyderabad(IIIT-海得拉巴学院计算机视觉研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MOTOR数据集,用于研究两轮车在密集无结构交通中的骑行行为,通过多视角、多模态数据融合,为自动驾驶辅助系统提供新的研究基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22366 2026-05-22 cs.CV 79%

AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

AgroTools: 一个用于农业中增强工具的多模态代理基准

Zi Ye, Yibin Wen, Xiaoya Fan, Xinyu Zhang, Jing Wu, Kun Zeng, Zurong Mai, Jiarui Zhang, Bohan Shi, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) Southwest University(西南大学) Northeastern University(东北大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Southwest Jiaotong University(西南交通大学) China Agricultural University(中国农业大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AgroTools基准,用于评估农业中增强工具的多模态代理,通过539个问题-答案实例和1097张异构农业图像,评估模型在工具使用中的执行质量和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18507 2026-05-22 cs.CV 79%

Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation

弱监督跨模态学习用于4D雷达场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

机构 * Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种弱监督的雷达场景流学习框架,利用图像和里程计进行辅助监督,通过实例感知的自监督损失和静态区域的刚性损失,实现了更高效的场景流估计。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03121 2026-05-22 cs.CR cs.AI 79%

Lost in Modality: Evaluating the Effectiveness of Text-Based Membership Inference Attacks on Large Multimodal Models

模态迷失:评估基于文本的成员推断攻击在大型多模态模型中的有效性

Ziyi Tong, Feifei Sun, Le Minh Nguyen

机构 * Japan Advanced Institute of Science and Technology - Information Science(日本科学技术先进研究院-信息科学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文评估了基于文本的成员推断攻击(MIAs)在多模态模型中的有效性,发现其在分布内设置中表现相似,而在分布外设置中视觉输入起到正则化作用,有效掩盖了成员信号。

Comments accepted by ESANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02014 2026-05-22 cs.CV 79%

Towards Selection of Large Multimodal Models as Engines for Burned-in Protected Health Information Detection in Medical Images

向大规模多模态模型选择作为医疗图像中已烧毁保护健康信息检测引擎的方向

Tuan Truong, Guillermo Jimenez Perez, Pedro Osorio, Matthias Lenga

机构 * QwenLM(通义实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了如何利用大规模多模态模型进行医疗图像中保护健康信息的检测,通过对比三种主流模型在不同流程配置下的表现,发现大规模多模态模型在OCR性能上优于传统方法,但整体检测准确性提升不显著,尤其在复杂印模模式测试中表现更优,并提出了针对特定操作约束的模型选择建议和部署策略。

Comments Accepted at EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21852 2026-05-22 cs.CV 79%

Seizure-Semiology-Suite (S3): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding

癫痫半相学套件(S3):一个临床多模态数据集、基准和模型用于癫痫半相学理解

Lina Zhang, Tonmoy Monsoor, Peizheng Li, Jiarui Cui, Xinyi Peng, Chong Han, Prateik Sinha, Siyuan Dai, Jessica Nichole Pasqua, Colin M McCrimmon, Weiting Liu, Hailey Marie Miranda, Bing Hu, Xiangting Wu, Tengyou Xu, Chunhan Li, Jiaye Tian, Jiarui Tang, Detao Ma, Lingye Kong, Junnan Lyu, Jungang Li, Yan Zan, Junhua Huang, Rajarshi Mazumder, Vwani Roychowdhury

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Pittsburgh(匹兹堡大学) Fudan University(复旦大学) University of California, Riverside(加州大学河滨分校) Hong Kong University of Science(香港科学大学) Maharishi International University(玛希拉国际大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出S3数据集和基准,用于细粒度、结构化的癫痫半相学理解,通过评估多模态大语言模型在低级视觉感知、时间序列处理、叙述报告生成和癫痫诊断中的能力,揭示了现有模型在左右脑推理、时间定位、症状序列和临床忠实报告方面的系统性弱点,并展示了针对癫痫的微调和双阶段神经符号框架在癫痫与非癫痫癫痫分类中的高F1分数。

Comments Accepted to ICML 2026 as a Spotlight presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21527 2026-05-22 eess.IV cs.CV cs.LG 79%

CryoNet: A Deep Learning Framework for Multi-Modal Debris-Covered Glacier Mapping. A Case Study of the Poiqu Basin, Central Himalaya

CryoNet:一种用于多模态冰川覆盖区制图的深度学习框架。帕iqu盆地,中央喜马拉雅地区案例研究

Farzaneh Barzegar, Tobias Bolch, Norbert Kuehtreiber, Silvia L. Ullo

机构 * University of Sannio(萨恩尼奥大学) Graz University of Technology(格拉茨技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究提出CryoNet,一种利用多模态数据集的深度学习框架,用于区分干净冰川、覆盖冰川和冰湖,通过在喜马拉雅中央帕iqu盆地的案例研究展示了其在复杂高山环境中的有效性。

Comments 15 pages, 10 figures, 5 tables. Preprint submitted to IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS); currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21251 2026-05-21 eess.IV cs.CV 79%

Local-sensitive connectivity filter (ls-cf): A post-processing unsupervised improvement of the frangi, hessian and vesselness filters for multimodal vessel segmentation

局部敏感连通性滤波器(ls-cf):一种后处理的无监督改进方法,用于多模态血管分割的Frangi、Hessian和血管性滤波器

Erick O Rodrigues, Lucas O Rodrigues, João HP Machado, Dalcimar Casanova, Marcelo Teixeira, Jeferson T Oliva, Giovani Bernardes, Panos Liatsis

机构 * Department of Academic Informatics (DAINF), Universidade Tecnologica Federal do Parana (UTFPR)(学术信息系(DAINF),技术联邦大学帕托布拉诺分校(UTFPR)) Graduate Program of Sciences Applied to Health Products, Universidade Federal Fluminense (UFF)(健康产品应用科学研究生项目,联邦大学弗洛里塞分校(UFF)) Institute of Technological Sciences (ICT), Universidade Federal de Itajuba (UNIFEI)(技术科学研究所,联邦大学伊塔比亚分校(UNIFEI)) Department of Electrical Engineering and Computer Science, Khalifa University of Science and Technology(电气工程与计算机科学系,卡利法科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种无监督的多模态方法,改进Frangi滤波器的响应,实现自动血管分割。通过计算像素级血管连续性并引入局部容忍启发式方法来填补Frangi响应产生的血管不连续性,提出局部敏感连通性滤波器(LS-CF),在多种多模态数据集上取得了有竞争力的结果,尤其在OSIRIX视网膜血管造影数据集中,其准确率优于现有最先进方法。

Journal ref Journal of Imaging 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20967 2026-05-21 cs.CL 79%

ArPoMeme: An Annotated Arabic Multimodal Dataset for Political Ideology and Polarization

ArPoMeme:一个标注的阿拉伯多模态数据集用于政治意识形态和极化

Wajdi Zaghouani, Kais Attia, Md. Rafiul Biswas, Fadhl Eryani

机构 * Northwestern University in Qatar(卡塔尔西北大学) Independent Researcher(独立研究员) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学) University of Tübingen(图宾根大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出ArPoMeme数据集,用于分析阿拉伯政治漫画的多模态和意识形态维度,通过自定义工具实现大规模标注,揭示意识形态极化特征。

Comments Accepted at LREC 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20458 2026-05-21 cs.CV 79%

ELEMENT: Multi-Modal Retinal Vessel Segmentation Based on a Coupled Region Growing and Machine Learning Approach

ELEMENT:基于耦合区域生长和机器学习方法的多模态视网膜血管分割

Erick O. Rodrigues, Aura Conci, Panos Liatsis

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于耦合区域生长和机器学习方法的多模态视网膜血管分割框架ELEMENT,通过区域生长和机器学习提取特征并进行像素分类,提高了分割的准确性和效率,实验表明其在多个数据集上均优于现有方法。

Journal ref IEEE Journal of Biomedical and Health Informatics 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10784 2026-05-21 cs.AI 79%

TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training

TorchUMM: 一个用于评估、分析和训练后处理的统一多模态模型代码库

Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios Savvides, Sharon Li, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Auburn University(阿肯色大学欧文分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TorchUMM,一个统一的多模态模型代码库,用于评估、分析和训练后处理,涵盖多种多模态模型架构、任务和数据集,通过统一接口和标准化评估协议,促进异构模型的公平比较和深入理解,推动更强大的统一多模态系统的发展。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19004 2026-05-20 cs.CV cs.LG cs.RO 79%

EgoTraj: Real-World Egocentric Human Trajectory Dataset for Multimodal Prediction

EgoTraj: 用于多模态预测的现实世界人轨迹数据集

Ahmad Yehia, Abduallah Mohamed, Tianyi Wang, Jiseop Byeon, Kun Qian, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(土木、建筑与环境工程系,德克萨斯大学奥斯汀分校) Meta Reality Labs(Meta现实实验室) School of Architecture, The University of Texas at Austin(建筑学院,德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EgoTraj数据集,用于多模态预测,包含75个真实城市环境中的人导航轨迹,提供了同步的RGB视频和地面真实数据,包括6自由度头部姿态、3D眼 gaze向量和场景注释,展示了该数据集在AR感知、导航和辅助系统中的应用价值。

Comments 21 pages, 14 figures. Project page: https://github.com/yehiahmad/EgoTraj

详情

展开后加载摘要…

URL PDF HTML 收藏