arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 105 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 105 篇

2608.10448 2026-08-19 cs.AI 版本更新 89%

Rationale-Guided Learning for Multimodal Emotion Recognition

基于理由引导学习的多模态情感识别

Sujung Oh, Jung Uk Kim, Sangmin Lee

专题命中 其他多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16586 2026-07-30 cs.CV 版本更新 85%

LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

LOCUS: 局部视觉线索搜索增强多模态大语言模型的细粒度感知

Zhou Tao, Fang Zhang, Zewen Ding, Shida Wang, Xiaokun Sun, YongXiang Hua, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(summary_cn);分类 cs.CV

AI总结 提出LOCUS训练框架,通过可验证的局部线索搜索代理任务,使MLLM内化细粒度证据选择,提升定位敏感视觉理解而不改变推理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25451 2026-07-08 cs.LG 版本更新 85%

BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

BigMac: 打破多模态大语言模型训练中的计算与内存帕累托前沿

Zili Zhang, Chengxu Yang, Shenglong Zhang, Chenyu Wang, Yufan Zhang, Tuo Dai, Zhouyang Li, Yuhong Ge, Chao Jin, Xin Jin, Yuliang Liu

机构 * Peking University(北京大学) Independent Researcher(独立研究员) Xiaohongshu, Inc(小红书公司)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 提出BigMac训练流水线,通过嵌套编码器和生成器计算到LLM流水线中,同时优化计算效率和内存使用,打破帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.11395 2026-08-21 cs.LG stat.ML 版本更新 82%

Multi-Modal Graph Interaction for Multi-Graph Convolution Network in Urban Spatiotemporal Forecasting

用于城市时空预测的多图卷积网络的多模态图交互

Lingyu Zhang, Xu Geng, Zhiwei Qin, Hongjun Wang, Xiao Wang, Ying Zhang, Jian Liang, Guobin Wu, Xuan Song, Yunhai Wang

专题命中 其他多模态 :multi-modal(title,abstract);multimodal(abstract)

AI总结 本研究针对城市时空预测问题,提出低层分组GCN与高层多线性关系GCN的多模态图交互方法,在网约车需求预测任务上优于现有基准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02153 2026-06-15 math.NA cs.NA math.OC 版本更新 82%

A Joint Variational Framework for Multimodal X-ray Ptychography and Fluorescence Reconstruction

多模态X射线ptychography与荧光重建的联合变分框架

Chengru Eric Zou, Elle Buser, Zichao Wendy Di, Yuanzhe Xi

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种联合变分框架,整合X射线ptychography和荧光重建,通过共享空间变量解决非线性逆问题,提升稳定性和重建精度。

Comments Keywords: inverse problems, x-ray imaging science, ill-posedness, joint reconstruction. This work is sponsored by NSF DMS-2338904

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17343 2026-07-14 cs.CV 版本更新 81%

EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection

EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测

Chenyang Zhu, Maorong Wang, Jun Liu, Ching-Chun Chang, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国家信息研究所)

专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。

Comments Template changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11621 2026-08-18 cs.AI cs.CL cs.LG 版本更新 81%

Lesioned Multimodal Language Models Reproduce Aphasic Picture-Naming Patterns

受损多模态语言模型再现失语症患者的图片命名模式

Yong Yang, Xiang Guan, Sophie Arheix-Parras, Saeed Ahmadi, Roger Newman-Norlund, Leonardo Bonilha, Christopher Rorden, Julius Fridriksson, Rutvik H. Desai, Srihari Nelakuditi

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究未针对临床模拟设计的通用语言模型能否再现失语症患者图片命名错误模式,通过对多模态语言模型进行扰动配置,建立定量框架再现个体失语症错误模式,表明语言模型或可成为中风后失语症患者数字替身。

Comments 15 pages, 8 figures; supplementary materials (18 pages, 6 sections) included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29064 2026-08-11 cs.CL cs.CV cs.HC cs.MA 版本更新 81%

Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation

分析多模态大语言模型代理在城市感知中生成解释的角色效应

Neemias da Silva, Matt Ratto, Myriam Delgado, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * Universidade Tecnologica Federal do Parana(巴西南里奥格兰德联邦技术大学) University of Toronto(多伦多大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 通过对比不同角色提示和无角色设置下多模态大语言模型生成的文本,发现标题描述趋同,但理由描述随社会经济和政治属性系统变化,感知标签无显著差异。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07328 2026-07-10 cs.LG cs.AI cs.CV cs.CY 版本更新 81%

MultiFair: Multimodal Balanced Fairness-Aware Medical Classification with Dual-Level Gradient Modulation

MultiFair:具有双级梯度调制的多模态平衡公平感知医学分类

Md Zubair, Hao Zheng, Grayson W. Armstrong, Lucy Q. Shen, Gabriela Wilson, Yu Tian, Xingquan Zhu

机构 * School of Computing and Informatics, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校计算机与信息学学院) Louisiana Center for Health Innovation and College of Nursing & Health Sciences, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校健康创新中心及护理与健康科学学院) Massachusetts Eye and Ear, Harvard Medical School(哈佛医学院马萨诸塞眼耳医院) Department of Computer Science, University of Central Florida(佛罗里达州立大学计算机科学系) Department of Electrical Engineering and Computer Science, Florida Atlantic University(佛罗里达Atlantic大学电子工程与计算机科学系)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态医学分类中数据模态学习不均衡和模型对特定群体不公平的问题,提出MultiFair方法,通过双级梯度调制过程动态调整训练梯度,在多数据集上评估,有效解决了上述挑战。

Comments This work has been accepted for publication in IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00215 2026-06-17 cs.CV cs.CL 版本更新 81%

Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design

通过奖励设计解耦多模态大语言模型中的感知与推理

Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系) Independent Researcher(独立研究者)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究多模态大模型中感知与推理的瓶颈,发现感知是主要约束,并通过奖励设计提升视觉基础推理,平均提升5.56分。

Comments 24 pages, 15 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01444 2026-06-16 cs.AI cs.CL cs.LG 版本更新 81%

Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning

双不确定性引导的多模态推理策略学习

Rui Liu, Dian Yu, Tong Zheng, Runpeng Dai, Zongxia Li, Wenhao Yu, Zhenwen Liang, Linfeng Song, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent Hunyuan(腾讯文汇) University of Maryland(马里兰大学) University of North Carolina(北卡罗来纳大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DUPL方法,通过量化感知不确定性和输出不确定性来引导策略更新,在多个多模态推理基准上显著提升模型准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28336 2026-08-17 cs.AI 版本更新 79%

Correcting What You Cannot See: Credit Assignment for Perception Distillation in Multimodal Reasoners

修正不可见之缺陷:多模态推理器中感知蒸馏的信用分配

Feng Xiong, Leyan Xue, Hongyu Lin

机构 * Thinking Machines Lab(思维机器实验室) DeepSeek-AI(深度求索公司)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对多模态推理器的感知蒸馏信用分配问题,提出感知修正蒸馏(PCD)方法,经8个基准测试,可提升不同规模模型的宏平均和结果,消融实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07632 2026-07-28 cs.LG cs.AI 版本更新 79%

Sheaf-Laplacian Obstruction and Projection Hardness for Cross-Modal Compatibility on a Modality-Independent Site

sheaf-Laplacian 障碍与投影难度分析跨模态兼容性在模态无关站点

Tibor Sloboda

机构 * Faculty of Informatics and Information Technology, Slovak Technical University(斯洛伐克技术大学信息学与信息技术学院) aleph0 s. r. o.

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出统一框架分析学习表示中的跨模态兼容性,通过模态无关邻域站点和有限维实内积空间细胞sheaf,定义投影难度和sheaf-Laplacian障碍,分析两种失败模式并推导稳定性与误差界。

Comments 31 pages, 7 figures, submitted to Annals of Mathematics and Artificial Intelligence of Springer Nature, post-major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15748 2026-07-15 cs.LG cs.CV 版本更新 79%

Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors

以大型多模态模型作为事后校正器的视觉物种识别

Tian Liu, Anwesha Basu, James Caverlee, Shu Kong

机构 * Texas A&M University(德克萨斯A&M大学) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究视觉物种识别问题,比较少样本学习专家模型与大型多模态模型后发现后者虽有不足但有互补优势,进而提出事后校正框架,利用多模态提示策略提升少样本学习专家模型准确率,该框架具有通用性和有效性。

Comments website and code: https://tian1327.github.io/POC

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08949 2026-07-08 cs.CV 版本更新 79%

Tuned Reverse Distillation: Enhancing Multimodal Industrial Anomaly Detection with Crossmodal Tuners

调谐反向蒸馏:使用跨模态调谐器增强多模态工业异常检测

Xinyue Liu, Jianyuan Wang, Biao Leng, Shuo Zhang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Key Laboratory of Intelligent Bionic Unmanned Systems, Ministry of Education(教育部智能仿生无人系统重点实验室) School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文针对多模态工业异常检测问题,提出基于多分支设计的调谐反向蒸馏方法,通过为各模态设独立分支及设计跨模态调谐器,增强模态交互,能更精细检测异常,实验验证其在多模态异常检测和定位上达最优性能。

Comments Accepted by TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新 79%

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06572 2026-06-12 cs.LG cs.AI 版本更新 79%

Hellinger Multimodal Variational Autoencoders

Hellinger多模态变分自编码器

Huyen Vo, Isabel Valera

机构 * Department of Computer Science, Saarland University(萨尔兰大学计算机科学系) MPI-SWS, Saarland Informatics Campus(萨尔兰信息学校区Max Planck研究所)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出基于Hellinger距离的矩匹配近似方法HELVAE,避免子采样,在多模态变分自编码器中实现更优的生成一致性与质量权衡。

Comments Accepted at AISTATS 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02568 2026-06-11 cs.AI 版本更新 79%

MLaGA: Multimodal Large Language and Graph Assistant

MLaGA: 多模态大语言与图助手

Dongzhe Fan, Yi Fang, Jiajin Liu, Djellel Difallah, Qiaoyu Tan

机构 * New York University(纽约大学) New York University Shanghai(纽约大学上海) New York University Brooklyn(纽约大学布鲁克林) Virginia Polytechnic Institute and State University(弗吉尼亚理工大学) New York University Abu Dhabi(纽约大学阿布扎克)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出MLaGA模型,通过结构感知多模态编码器和指令微调,将大语言模型扩展到多模态图数据,在监督和迁移学习任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01539 2026-07-07 hep-ph hep-ex hep-th nucl-ex nucl-th 版本更新 79%

Multimodal Fragmentation of All-Heavy Pentaquarks: Uncertainty-Aware Predictions for Hadron Colliders

所有重子五夸克的多模碎片化:用于强子对撞机的不确定性感知预测

Francesco Giovanni Celiberto

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出考虑不确定性的主导功率碎片化描述,用于研究强子对撞机中所有charm五夸克态的碎片化,构建多模碎片函数集PQ5Q1.1,结合微扰与非微扰不确定性,优化初始尺度输入以描述多夸克和双夸克产生机制,并应用于HL-LHC及未来FCC。

Comments 51 pages, 9 figures, 1 table, 264 references, version published in Phys. Rev. D. One novel set of multimodal (direct multicharm and diquark-like initial-scale inputs) PQ5Q1.1 NLO collinear fragmentation functions. Includes F-MHOU and F-NPWF uncertainty replicas, threshold-aware HF-NRevo DGLAP evolution, and LHAPDF release at https://github.com/FGCeliberto/Collinear_FFs

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07104 2026-08-21 cs.CV cs.AI 版本更新 79%

Extended to Reality: Prompt Injection in 3D Environments

扩展到现实:3D环境中的提示注入

Zhuoheng Li, Ying Chen

专题命中 其他多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05163 2026-08-19 physics.optics cond-mat.mes-hall quant-ph 版本更新 78%

Topology and criticality in non-Hermitian multimodal optical resonators through engineered losses

通过可控损耗实现非厄米多模光学谐振器中的拓扑与临界性

Elizabeth Louis Pereira, Hongwei Li, Andrea Blanco-Redondo, Jose L. Lado

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本研究提出多模非厄米晶格模型,证实其可呈现拓扑模式与临界性,分析其对损耗波动等的鲁棒性,发现可通过外部规范场调控局域化特性,为可控非厄米拓扑设计提供新策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18990 2026-08-17 physics.med-ph cs.NA math.NA 版本更新 78%

Quantitative Multi-Modal Optical Coherence Photoacoustic Elastography

定量多模态光学相干光声弹性成像

Ekaterina Sherina, Lisa Krainz, Wolfgang Drexler, Otmar Scherzer

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 提出结合光学相干断层扫描(OCT)和光声断层扫描(PAT)的多模态弹性成像框架,通过混合反演算法融合互补信息,在硅胶体模上实现更高信噪比和更准确的刚度估计。

Comments 10 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04430 2026-08-11 math.NA cs.NA stat.ML 版本更新 78%

An adaptive split-combine Gaussian mixture filter for nonlinear and multimodal state estimation

面向非线性与多模态状态估计的自适应拆分-合并高斯混合滤波器

San Kim, Won Chang, Daniel B. Forger, Dae Wook Kim

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文针对非线性多模态状态估计问题,提出自适应拆分-合并高斯混合滤波器(AMF),通过拆分合并高斯粒子实现高效准确的PDF估计,在多基准测试中性能优于基线滤波器,还提出了其并行实现方案。

Comments 60 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27048 2026-07-13 cs.RO 版本更新 78%

SpikeATac: A Multimodal Tactile Finger with Taxelized Dynamic Sensing for Dexterous Manipulation

SpikeATac: 一种多模态触觉指尖,具有像素化动态传感的灵活操作

Eric T. Chang, Peter Ballentine, Zhanpeng He, Do-Gon Kim, Kai Jiang, Hua-Hsuan Liang, Joaquin Palacios, William Wang, Pedro Piacenza, Ioannis Kymissis, Matei Ciocarlie

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 SpikeATac通过结合动态和静态触觉传感技术,实现对易碎物体的灵活操控,利用强化学习优化力调节能力。

Comments 8 pages, 8 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09978 2026-07-09 cs.CE 版本更新 78%

RoadFed: A Multimodal Federated Learning System for Improving Road Safety

RoadFed:用于提高道路安全的多模态联邦学习系统

Yachao Yuan, Zhen Yu, Yali Yuan, Xingyu Chen, Yingwen Wu, Thar Baker

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对道路危险检测,提出多模态联邦学习系统RoadFed,包含多模态检测器、通信高效联邦学习法及局部差分隐私方法,在真实世界和公共数据集上实验,其准确率高、延迟低、通信成本低,能跨模态跨边缘协作训练并保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04136 2026-07-03 eess.SP 版本更新 78%

FLAME: A Federated Learning Approach for Multi-Modal RF Fingerprinting

FLAME:一种用于多模态射频指纹识别的联邦学习方法

Kasra Borazjani, Kiarash Kianfar, Seyyedali Hosseinalipour, Rajeev Sahay

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 提出FLAME框架,通过多模态表示(超越I/Q样本)加速联邦学习在射频指纹识别中的训练,理论证明收敛更快且精度更高,实验验证其优越性。

Comments 21 pages, 16 figures. Published in IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29629 2026-07-01 cs.DC 版本更新 78%

Energy-Efficient Multimodal Inference Serving with Tri-serve

能效多模态推理服务:Tri-serve

Ziyang Jia, Sara Rashidi Golrouye, Laxmi Bhuyan, Benjamin Kubwimana, Devashree Tripathy, Zexin Li, Cong Liu, Daniel Wong

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对多模态推理服务中GPU硬件频率管理导致的三种能效问题,提出软件DVFS控制器Tri-serve,联合优化依赖停顿、算术强度影响和热节流,实现22%能效提升且无延迟或吞吐量损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05708 2026-06-29 q-bio.QM 版本更新 78%

HuBMAP Data Portal: A Resource for Multimodal Spatial and Single-Cell Data of Healthy Human Tissues

HuBMAP 数据门户:健康人体组织多模态空间和单细胞数据的资源

Morgan L. Turner, Thomas C. Smits, Tiffany S. Liaw, Brendan Honick, Bill Shirey, Lisa Choy, Nikolay Akhmetov, Shaokun An, David Betancur, Dominic Bordelon, Karl Burke, Ivan Cao-Berg, John Conroy, Chris Csonka, Penny Cuda, Sean Donahue, Stephen Fisher, Derek Furst, Ed Hanna, Josef Hardi, Tabassum Kakar, Mark S. Keller, Devin Lange, Xiang Li, Yan Ma, Alison McWilliams, Austen Money, Richard Morgan, Eric Moerth, Juan Muerto, Mark A. Musen, Emily Nic, Martin J. O'Connor, Gesina Phillips, Alexander J. Ropelewski, Ryan Sablosky, Sravani Saripalli, Max Sibilla, Derek Simmel, Alan Simmons, Xu Tang, Joel Welling, Zhou Yuan, Martin Hemberg, HuBMAP Consortium, Matthew Ruffalo, Jonathan Silverstein, Philip Blood, Nils Gehlenborg

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 介绍 HuBMAP 数据门户,一个整合健康人体组织多模态空间和单细胞数据的综合平台,支持搜索、可视化和分析,并通过统一处理流程确保数据可比性。

Comments 43 pages; 8 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04451 2026-08-10 cs.CV 版本更新 77%

RemoteZero: Geospatial Reasoning with Zero Labels

RemoteZero:零样本地理空间推理

Liang Yao, Fan Liu, Shengxiang Xu, Chuanyi Zhang, Rui Min, Shimin Di, Yuhui Zheng

专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22784 2026-07-13 cs.CV cs.AI cs.RO 版本更新 76%

Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching

基于监督跨模态特征匹配的单帧点像素配准

Yu Han, Zhiwei Huang, Yanting Zhang, Fangjun Ding, Shen Cai, Xiaoyu Tang, Yanchao Dong, Rui Fan

机构 * School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 其他多模态 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 研究激光雷达点云和相机图像的点像素配准难题,提出基于投影的无检测器框架及重复性评分机制,通过实验证明该方法在单帧激光雷达下能达先进性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏