A2DINOv3: Rethinking Multi-Modal Object Detection via Socialized Collaboration
A2DINOv3:通过社会化协作重新思考多模态目标检测
专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 本文提出A2DINOv3框架,通过社会化协作协议让RGB与红外分支以异构专家模式选择性交互,结合零初始化策略,在四个多模态基准上实现了多模态目标检测的SOTA性能。
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
A2DINOv3:通过社会化协作重新思考多模态目标检测
专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 本文提出A2DINOv3框架,通过社会化协作协议让RGB与红外分支以异构专家模式选择性交互,结合零初始化策略,在四个多模态基准上实现了多模态目标检测的SOTA性能。
机械滥用下锂离子电池热失控的红外热点引导预警
专题命中 红外-可见光融合 :multimodal fusion(abstract)
AI总结 针对机械滥用下锂离子电池热失控预警问题,提出两阶段融合红外热点动态与多模态特征的方法,经实验验证可实现更早的预警与更高的ROC-AUC。
当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引
专题命中 遥感融合与全色锐化 :pansharpening(abstract,abstract_cn);分类 cs.CV、cs.MM
AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。
Comments 20 pages, 7 figures, and 20 tables
SuppreSensing:面向多模态目标检测的专家引导特征重校准与差异增强
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV
AI总结 针对遥感多模态目标检测的语义异质性与模态噪声问题,本文提出SuppreSensing,通过EMFR模块、差异增强策略和ECFP模块实现最优性能,在多个数据集上达到SOTA并具备良好泛化性。
Comments 10 pages
ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法
机构 * Xiaomi Robotics(小米机器人)
专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO
AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。
Comments 11 pages, 7 figures. Project page: this https URL (https://vitacphys.github.io/ViTacPhys/)
将手工知识与学习表示融合何时有效?一种针对堆叠、替代和干扰的成本归一化基准
机构 * Universitat de Barcelona(巴塞罗那大学) ; Technical University of Munich(慕尼黑工业大学) ; Universitat Pompeu Fabra(庞培法布拉大学)
专题命中 融合架构与评测 :decision-level fusion(abstract);分类 cs.CV
AI总结 该研究以成本归一化基准分析手工知识与学习表示融合的效果,发现三种结果并提出可预测端到端增益的分解式。
用于模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表示学习
专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV
AI总结 本研究提出ScoliDetect框架,通过运动学知识图谱(KKM)实现多模态步态分析,其介导的融合结合三模态对比预训练提升了脊柱侧凸筛查的泛化性与可解释性,外部ROC-AUC达0.972。