arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2409.07388 2026-04-08 cs.CL 79%

Recent Advances in Multimodal Affective Computing: An NLP Perspective

多模态情感计算近期进展:自然语言处理视角

Guimin Hu, Weimin Lyu, Chang Sun, Zhihong Zhu, Lin Gui, Ruichu Cai, Erik Cambria, Hasti Seifi

机构 * Guangdong University of Technology(广东工业大学) Stony Brook University(石溪大学) University of Bologna(博洛尼亚大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文从自然语言处理视角系统回顾了多模态情感计算的最新进展,聚焦于多模态情感分析、对话中多模态情绪识别、基于方面的多模态情感分析及多标签情绪识别等四个任务,提出统一视角并探讨相关方向与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04207 2026-04-07 cs.AI 79%

Don't Blink: Evidence Collapse during Multimodal Reasoning

不要眨眼:多模态推理中的证据崩溃

Suresh Raghu, Satwik Pandey

机构 * Independent Researcher, New Delhi, India(独立研究者,印度新德里)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究发现多模态推理过程中证据逐渐消失的现象,提出通过视觉-熵交互模型降低风险,提升模型在分布偏移下的安全性。

Comments 8 pages, 6 figures, 1 table, plus appendix. Submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03505 2026-04-07 cs.CV 79%

Multimodal Urban Tree Detection from Satellite and Street-Level Imagery via Annotation-Efficient Deep Learning Strategies

通过高效深度学习策略实现多模态城市树木检测:结合卫星和街景图像

In Seon Kim, Ali Moghimi

机构 * Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) Department of Biological and Agricultural Engineering, University of California, Davis(加州大学戴维斯分校生物与农业工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态框架,结合高分辨率卫星图像与地面Google街景图像,实现低标注条件下城市树木的高效检测。通过领域自适应和三种学习策略(半监督、主动学习、混合策略),提升检测精度,混合策略F1-score达0.90,显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01586 2026-04-07 cs.CV 79%

HandMCM: Multi-modal Point Cloud-based Correspondence State Space Model for 3D Hand Pose Estimation

HandMCM:基于多模态点云的对应状态空间模型用于3D手姿态估计

Wencan Cheng, Gim Hee Lee

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出HandMCM,通过结合局部信息注入/过滤模块和对应建模,利用状态空间模型提升3D手姿态估计的鲁棒性和精度,实验表明其在严重遮挡场景中优于现有方法。

Comments AAAI accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03050 2026-04-06 cs.HC cs.AI 79%

MECO: A Multimodal Dataset for Emotion and Cognitive Understanding in Older Adults

MECO:一种用于老年人情绪和认知理解的多模态数据集

Hongbin Chen, Jie Li, Wei Wang, Siyang Song, Xiao Gu, Jianqing Li, Wentao Xiang

机构 * Nanjing Medical University(南京医科大学) University of Exeter(埃克塞特大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MECO数据集通过收集42名老年人的多模态信号,提供30592个同步样本,旨在填补老龄化群体情绪和认知预测研究的空白,支持个性化情绪识别和早期轻度认知障碍检测。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03016 2026-04-06 cs.AI 79%

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Agentic-MME:代理能力为多模态智能带来了什么?

Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming Wang, Shuang Chen, Zechen Li, Yang Shi, Yuqi Tang, Weining Wang, Yi Yu, Chaoyou Fu, Qi Li, Yi-Fan Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) SEU(东南大学) NJU(南京大学) PKU(北京大学) BUAA(北京航空航天大学) NTU(南洋理工大学) UCLA(加州大学洛杉矶分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 Agentic-MME通过418个真实任务评估多模态代理能力,采用过程验证方法,量化效率并验证工具调用准确性,实验显示模型在复杂任务中表现显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02798 2026-04-06 cs.MM 79%

Differential Mental Disorder Detection with Psychology-Inspired Multimodal Stimuli

基于心理学启发的多模态刺激的差异性精神障碍检测

Zhiyuan Zhou, Jingjing Wu, Zhibo Lei, Junyu Guo, Zhongcheng Yu, Yuqi Chu, Xiaowei Zhang, Qiqi Zhao, Qi Wang, Shijie Hao, Yanrong Guo, Richang Hong

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出基于心理学启发的多模态刺激方法,通过收集大规模多模态心理健康数据集,设计出能捕捉不同精神障碍特征的框架,实验表明该方法在差异性精神障碍检测中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17069 2026-04-06 cs.CV 79%

Edge-Efficient Two-Stream Multimodal Architecture for Non-Intrusive Bathroom Fall Detection

边缘高效双流多模态架构用于非侵入式浴室跌倒检测

Haitian Wang, Yiren Wang, Xinyu Wang, Sheldon Fung, Atif Mansoor

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出双流架构以编码雷达信号和地面振动,通过低秩双线性交互和Switch-MoE头对齐动与冲击token,提升浴室跌倒检测的准确性和效率。

Comments This paper has been accepted for poster presenation at IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01916 2026-04-03 cs.CL 79%

SURE: Synergistic Uncertainty-aware Reasoning for Multimodal Emotion Recognition in Conversations

SURE:用于对话中多模态情绪识别的协同不确定性推理

Yiqiang Cai, Chengyan Wu, Bolei Ma, Bo Chen, Yun Xue, Julia Hirschberg, Ziwei Gong

机构 * Guangdong Provincial Key Laboratory of Quantum Engineering and Quantum Materials(广东省量子工程与量子材料重点实验室) School of Electronic Science and Engineering (School of Microelectronics), South China Normal University(华南师范大学电子科学与工程学院(微电子学院)) Shenzhen University(深圳大学) Columbia University(哥伦比亚大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 SURE通过整合多模态信号并增强鲁棒性和上下文建模,改进了对话中情绪识别的不确定性处理和细粒度推理能力。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01433 2026-04-03 cs.ET cs.AI eess.SP 79%

Semantically Annotated Multimodal Dataset for RF Interpretation and Prediction

语义标注的多模态数据集用于射频解释与预测

Steve Blandino, Jelena Senic, Raied Caromi, Samuel Berweger, Anuraag Bodi, Camillo Gentile, Nada Golmie

机构 * National Institute of Standards and Technology (NIST)(美国国家标准与技术研究院) Prometheus Computing LLC(普罗米修斯计算有限责任公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出结合射频测量与视觉数据的多模态数据集,用于提升射频信号与物理环境的解释与预测能力。

Journal ref NeurIPS 2025 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00580 2026-04-03 cs.RO cs.AI 79%

OmniUnet: A Multimodal Network for Unstructured Terrain Segmentation on Planetary Rovers Using RGB, Depth, and Thermal Imagery

OmniUnet:一种多模态网络,用于使用RGB、深度和热成像的无结构地形分割在火星车上的应用

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * University of Luxembourg(卢森堡大学) Universidad de Málaga(马拉加大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 OmniUnet通过整合RGB、深度和热成像数据,实现无结构地形的高效分割,利用自定义传感器设备在西班牙Bardenas半沙漠收集数据,并在资源受限设备上验证了其性能。

Journal ref 2025 International Conference on Space Robotics (iSpaRo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00940 2026-04-02 cs.CV 79%

YieldSAT: A Multimodal Benchmark Dataset for High-Resolution Crop Yield Prediction

YieldSAT:一个用于高分辨率作物产量预测的多模态基准数据集

Miro Miranda, Deepak Pathak, Patrick Helber, Benjamin Bischke, Hiba Najjar, Francisco Mena, Cristhian Sanchez, Akshay Pai, Diego Arenas, Matias Valdenegro-Toro, Marcela Charfuelan, Marlon Nuske, Andreas Dengel

机构 * RPTU Kaiserslautern-Landau(凯泽斯劳滕-兰道大学) DFKI GmbH(德国人工智能研究中心) Vision Impulse GmbH(Vision Impulse 有限公司) University of Groningen(格罗宁根大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出YieldSAT数据集,通过多模态数据提升高分辨率作物产量预测的准确性,包含1220万样本及多光谱图像,展示了大规模像素回归任务的潜力及领域适应方法的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29630 2026-04-02 cs.CV 79%

BigEarthNet.txt: A Large-Scale Multi-Sensor Image-Text Dataset and Benchmark for Earth Observation

BigEarthNet.txt: 一个大规模多传感器图像-文本数据集和地球观测基准

Johann-Ludwig Herzog, Mathis Jürgen Adler, Leonard Hackel, Yan Shu, Angelos Zavras, Ioannis Papoutsis, Paolo Rota, Begüm Demir

机构 * BIFOLD(柏林智能数据与机器学习研究所) Technische Universität Berlin(柏林工业大学) University of Trento(特伦托大学) National Technical University(雅典国家技术大学) National Observatory of Athens(雅典国家天文台)

专题命中 多模态评测 :image-text(title,abstract);分类 cs.CV

AI总结 本文提出BigEarthNet.txt,一个大规模多传感器图像-文本数据集,用于提升地球观测中的指令驱动图像-文本学习,包含9.6M文本注释,涵盖土地利用/覆盖类、空间关系及环境背景描述,通过对比分析证明其在文本丰富性和注释类型多样性上的优势。

Comments For details, see https://txt.bigearth.net

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18551 2026-04-02 cs.CV 79%

A 3D Cross-modal Keypoint Descriptor for MR-US Matching and Registration

一种用于MRI-US匹配和配准的3D跨模态关键点描述符

Daniil Morozov, Reuben Dorent, Nazim Haouchine

机构 * Harvard Medical School(哈佛医学院) Brigham and Women’s Hospital(布莱根妇女医院) Inria(法国国家信息与自动化研究所) Sorbonne Université(索邦大学) Institut du Cerveau - Paris Brain Institute - ICM, CNRS, Inserm, AP-HP, Hôpital de la Pitié Salpêtrière(巴黎大脑研究所 - ICM, 法国国家科学研究中心, 法国国家健康与医学研究院, 巴黎公立医院集团, 皮提耶-萨勒佩特里医院) Technical University of Munich(慕尼黑工业大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种3D跨模态关键点描述符,通过合成iUS体积进行患者特异性匹配,学习共享描述空间,实现鲁棒且旋转不变的配准。

Comments Accepted in IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29677 2026-04-01 cs.LG cs.AI 79%

Mind the Gap: A Framework for Assessing Pitfalls in Multimodal Active Learning

注意差距:一个多模态主动学习中陷阱评估的框架

Dustin Eisenhardt, Yunhee Jeong, Florian Buettner

机构 * German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联盟(DKTK)) UCT Frankfurt-Marburg(法兰克福-马尔堡大学癌症中心) Institute of Informatics, Goethe University Frankfurt(法兰克福歌德大学信息学研究所) Department of Medicine, Goethe University Frankfurt(法兰克福歌德大学医学系) Frankfurt Cancer Institute (FCI)(法兰克福癌症研究所(FCI)) Crop Science Division, Bayer AG(拜耳股份公司作物科学部)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一个多模态主动学习评估框架,通过合成数据集系统评估主动学习策略,发现模型易产生不平衡表示,现有方法无法缓解此问题,需设计模态感知的查询策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29199 2026-04-01 cs.AI 79%

AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction

AEC-Bench:一种用于建筑、工程和施工领域代理系统的多模态基准

Harsh Mankodiya, Chase Gallik, Theodoros Galanos, Andriy Mulyar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 AEC-Bench旨在评估建筑、工程和施工领域代理系统在真实任务中的表现,涵盖图纸理解、跨表单推理和项目级协调任务,通过多模型基准测试提升基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28784 2026-04-01 eess.SP cs.AI 79%

A Multi-Modal Dataset for Ground Reaction Force Estimation Using Consumer Wearable Sensors

一种用于使用消费级可穿戴传感器估计地面反作用力的多模态数据集

Parvin Ghaffarzadeh, Debarati Chakraborty, Koorosh Aslansefat, Ali Dostan, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学) Nottingham Trent University(诺丁汉特伦特大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出一个多模态数据集,用于通过苹果手表传感器估计垂直地面反作用力,包含惯性测量单元和力板数据,支持可穿戴生物力学研究和机器学习模型评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06874 2026-04-01 cs.CV 79%

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ByteDance(字节跳动) Tianjin University of Science and Technology(天津科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。

Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02536 2026-04-01 cs.CV 79%

MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark

MovieRecapsQA: 一种多模态开放式视频问答基准

Shaden Shaar, Bradon Thymes, Sirawut Chaixanien, Claire Cardie, Bharath Hariharan

机构 * Cornell University(康奈尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MovieRecapsQA基准,通过电影回顾视频生成8200个开放式问题及事实,构建无参考评估指标,评估多模态能力,发现视觉感知是主要瓶颈。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28550 2026-03-31 cs.CV 79%

MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures

MarkushGrapher-2:端到端多模态识别化学结构

Tim Strohmeyer, Lucas Morin, Gerhard Ingmar Meijer, Valéry Weber, Ahmed Nassar, Peter Staar

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MarkushGrapher-2,通过OCR提取化学图像文本,结合视觉-文本-布局编码器和光学化学结构识别编码器,实现多模态化学结构识别,并通过两阶段训练策略提升性能,同时构建大规模真实世界Markush结构数据集。

Comments 15 pages, to be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV 79%

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26952 2026-03-31 cs.CV cs.LG 79%

Multimodal Deep Learning for Diabetic Foot Ulcer Staging Using Integrated RGB and Thermal Imaging

多模态深度学习在结合RGB和热成像的糖尿病足溃疡分期中的应用

Gulengul Mermer, Mustafa Furkan Aksu, Gozde Ozsezer, Sevki Cetinkalp, Orhan Er, Mehmet Kemal Gullu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了多模态图像对深度学习模型在糖尿病足溃疡分期中的影响,通过RGB和热成像数据结合提升模型性能,VGG16模型在RGB+热成像数据集上达到93.25%的准确率。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12378 2026-03-31 cs.CV 79%

M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction

M4Human: 一种大规模多模态毫米波雷达基准用于人体网格重建

Junqiao Fan, Yunjiao Zhou, Yizhuo Yang, Xinyuan Cui, Jiarui Zhang, Lihua Xie, Jianfei Yang, Chris Xiaoxuan Lu, Fangqiang Ding

机构 * NTU(南洋理工大学) University of Edinburgh(爱丁堡大学) UPenn(宾夕法尼亚大学) UCL(伦敦大学学院) MIT(麻省理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出M4Human,首个大规模多模态毫米波雷达基准,提供高分辨率雷达、RGB和深度数据,用于解决传统视觉传感的遮挡、光照和隐私问题,推动人体建模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26498 2026-03-30 cs.DC cs.AI 79%

Rocks, Pebbles and Sand: Modality-aware Scheduling for Multimodal Large Language Model Inference

岩石、鹅卵石和沙子:面向多模态大语言模型推理的模态感知调度

Konstantinos Papaioannou, Thaleia Dimitra Doudali

机构 * IMDEA Software Institute(IMDEA软件研究所) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型推理中资源需求差异大导致的延迟和内存问题,提出RPS-Serve调度器,通过动态优先级和老化机制实现高效资源利用,降低TTFT并提升响应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26316 2026-03-30 cs.CV cs.LG 79%

SALMUBench: A Benchmark for Sensitive Association-Level Multimodal Unlearning

SALMUBench:一种用于敏感关联级多模态反训练的基准

Cai Selvas-Sala, Lei Kang, Lluis Gomez

机构 * Computer Vision Center(计算机视觉中心) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SALMUBench基准,用于评估多模态反训练中敏感信息删除的效果,通过合成数据和基础模型测试发现现有方法存在遗忘不足或过度泛化问题。

Comments Accepted to CVPR 2026. Project page: http://cvc-mmu.github.io/salmubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13239 2026-03-30 cs.CY cs.CV cs.IR 79%

CrisiSense-RAG: Crisis Sensing Multimodal Retrieval-Augmented Generation for Rapid Disaster Impact Assessment

CrisiSense-RAG:面向快速灾害影响评估的多模态检索增强生成系统

Yiming Xiao, Kai Yin, Ali Mostafavi

机构 * Zachry Department of Civil Environmental Engineering, Texas A\&M University Department of Computer Science Engineering, Texas A\&M University

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CrisiSense-RAG系统,通过多模态检索增强生成技术,解决灾害影响评估中时空不对齐问题,实现零样本设置下的高精度灾害评估。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19844 2026-03-27 cs.CV 79%

Hyper-Connections for Adaptive Multi-Modal MRI Brain Tumor Segmentation

超连接用于自适应多模态MRI脑肿瘤分割

Lokendra Kumar, Shubham Aggarwal

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出超连接用于体积多模态脑肿瘤分割,通过在五个架构中替代固定残差连接,提升BraTS 2021数据集上模型性能,尤其在增强肿瘤区域表现突出。

Comments 29 pages,6 tables,17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08750 2026-03-27 cs.CL 79%

A Geolocation-Aware Multimodal Approach for Ecological Prediction

一种面向地理定位的多模态方法用于生态预测

Valerie Zermatten, Chiara Vanalli, Gencer Sumbul, Diego Marcos, Devis Tuia

机构 * ECEO, Ecole Polytechnique Fédérale de Lausanne (EPFL)(ECEO,洛桑联邦理工学院(EPFL)) INRIA, University of Montpellier(法国国家信息与自动化研究所(INRIA),蒙彼利埃大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出GAMMA方法,通过显式空间上下文融合异构生态数据,提升环境预测性能,并展示其在大规模环境制图和生物多样性监测中的潜力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19918 2026-03-27 cs.CV 79%

Widget2Code: From Visual Widgets to UI Code via Multimodal LLMs

Widget2Code: 通过多模态大语言模型从视觉小部件到UI代码

Houston H. Zhang, Tao Zhang, Baoze Lin, Yuanqi Xue, Yincheng Zhu, Huan Liu, Li Gu, Linfeng Ye, Ziqiang Wang, Xinxin Zuo, Yang Wang, Yuanhao Yu, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Concordia University(康考迪亚大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Widget2Code任务,通过多模态大语言模型提升小部件到UI代码的生成能力,设计了图像-only基准测试和WidgetFactory框架,提升视觉保真度。

Comments CVPR 2026, Code: https://github.com/Djanghao/widget2code

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23265 2026-03-27 cs.CV 79%

SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models

SPR-128K:一种多模态大语言模型空间合理性推理的新基准

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SPR-128K数据集及DPA-GRPO方法,解决图像筛选中多模态大语言模型空间推理能力不足的问题,实验表明小型模型在该任务上优于主流模型。

详情

展开后加载摘要…

URL PDF HTML 收藏