arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-11-25 至 2025-11-25 共收录 13 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2510.10471 2025-11-25 cs.CV cs.LG 57%

DAGLFNet: Deep Feature Attention Guided Global and Local Feature Fusion for Pseudo-Image Point Cloud Segmentation

DAGLFNet:基于伪图像的深度特征注意力引导的全局和局部特征融合用于伪图像点云分割

Chuang Chen, Yi Lin, Bo Wang, Jing Hu, Xi Wu, Wenyi Ge

机构 * College of Computer Science, Chengdu University of Information Technology(成都信息科技大学计算机学院) College of Computer Science, Sichuan University(四川大学计算机学院) Publications Department, Optica Publishing Group(Optica出版社出版部) Department of Electronic Journals, Optica Publishing Group(Optica出版社电子期刊部)

专题命中 通用Image Fusion :information fusion(abstract);分类 cs.CV

AI总结 DAGLFNet通过深度特征注意力引导的全局和局部特征融合,提升伪图像点云分割的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2510.13404 2025-11-25 cs.LG 50%

SWIR-LightFusion: Multi-spectral Semantic Fusion of Synthetic SWIR with Thermal IR (LWIR/MWIR) and RGB

SWIR-LightFusion: 多光谱合成SWIR与热红外(LWIR/MWIR)及RGB的语义融合

Muhammad Ishfaq Hussain, Ma Van Linh, Zubia Naz, Unse Fatima, Yeongmin Ko, Moongu Jeon

机构 * GIST(韩国全南大学) Kyungpook National University(庆尚国立大学) KISTI(韩国科学技术院)

专题命中 红外-可见光融合 :multimodal fusion(abstract)

AI总结 本文提出SWIR-LightFusion框架,通过合成SWIR图像融合LWIR、RGB多模态数据,提升恶劣环境下的场景理解能力。

Journal ref Cluster Computing (Springer) as Volume 29, Issue 1, Article 48, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 遥感融合与全色锐化 2 篇

2505.23206 2025-11-25 cs.CV 74%

HyperPointFormer: Multimodal Fusion in 3D Space with Dual-Branch Cross-Attention Transformers

HyperPointFormer: 在三维空间中通过双分支交叉注意力变换器实现多模态融合

Aldino Rizaldy, Richard Gloaguen, Fabian Ewald Fassnacht, Pedram Ghamisi

机构 * Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗斯托克亥姆霍尔茨研究中心) Freie Universität Berlin(柏林自由大学)

专题命中 遥感融合与全色锐化 :multimodal fusion(title);分类 cs.CV

AI总结 HyperPointFormer通过双分支交叉注意力Transformer在三维空间中融合多模态数据,提升城市场景土地利用分类的精度与灵活性。

Journal ref IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, vol. 18, pp. 21254-21274, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18888 2025-11-25 cs.CV 57%

MFmamba: A Multi-function Network for Panchromatic Image Resolution Restoration Based on State-Space Model

MFmamba:基于状态空间模型的多功能网络用于全色图像分辨率恢复

Qian Jiang, Qianqian Wang, Xin Jin, Michal Wozniak, Shaowen Yao, Wei Zhou

专题命中 遥感融合与全色锐化 :pansharpening(abstract);分类 cs.CV

AI总结 MFmamba通过三种不同输入实现高空间分辨率彩色图像恢复,结合UNet++、Mamba Upsample Block和Dual Pool Attention,提升超分辨率与光谱恢复性能。

Comments 9 pages, 9 figures. This paper has been accepted for publication in AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人多传感器融合 2 篇

2511.17927 2025-11-25 cs.CV cs.AI 57%

PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning

PA-FAS: 向可解释和通用的多模态人脸反伪装迈进:通过路径增强强化学习

Yingjie Ma, Xun Lin, Yong Xu, Weicheng Xie, Zitong Yu

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 PA-FAS通过路径增强强化学习提升多模态人脸反伪装的可解释性和泛化能力。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08909 2025-11-25 cs.RO cs.SY eess.SY 57%

Continuous Gaussian Process Pre-Optimization for Asynchronous Event-Inertial Odometry

连续高斯过程预优化用于异步事件-惯性里程计

Zhixiang Wang, Xudong Li, Yizhai Zhang, Fan Zhang, Panfeng Huang

机构 * IEEE

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 本文提出GPO方法,通过连续时间高斯过程预整合提升异步事件-惯性里程计的精度和效率。

Comments 8pages

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 1, pp. 282-289, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 7 篇

2401.00728 2025-11-25 eess.IV cs.CV cs.LG 81%

MultiFusionNet: Multilayer Multimodal Fusion of Deep Neural Networks for Chest X-Ray Image Classification

MultiFusionNet:多层多模态融合的深度神经网络用于胸部X光图像分类

Saurabh Agarwal, K. V. Arya, Yogesh Kumar Meena

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV、eess.IV

AI总结 MultiFusionNet通过多层多模态融合和FDSFM模块提升胸部X光图像分类的准确率,达到97.21%和99.60%

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17965 2025-11-25 cs.CV cs.MM 62%

Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification

信号:选择性交互与全局-局部对齐用于多模态对象重识别

Yangyang Liu, Yuhao Wang, Pingping Zhang

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV、cs.MM

AI总结 Signal通过选择性交互和全局-局部对齐框架提升多模态对象重识别的性能。

Comments Accepted by AAAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18865 2025-11-25 cs.CV 57%

DualGazeNet: A Biologically Inspired Dual-Gaze Query Network for Salient Object Detection

DualGazeNet: 一种生物启发的双目注视查询网络用于显著物体检测

Yu Zhang, Haoan Ping, Yuchen Li, Zhenshan Bing, Fuchun Sun, Alois Knoll

机构 * School of Computation, Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学) Department of Informatics, Technical University of Munich(信息学院,慕尼黑技术大学) University Research and Innovation Center, Obuda University(奥布达大学研究与创新中心) State Key Laboratory for Novel Software Technology, Nanjing University Suzhou Campus(新型软件技术国家重点实验室,南京大学苏州校区) School of Science and Technology, Nanjing University Suzhou Campus(科学与技术学院,南京大学苏州校区) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 DualGazeNet通过生物启发的纯Transformer框架,实现了显著物体检测的高效准确性和计算效率,超越了多种现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18028 2025-11-25 cs.CV 57%

MambaX: Image Super-Resolution with State Predictive Control

MambaX:基于状态预测控制的图像超分辨率

Chenyu Li, Danfeng Hong, Bing Zhang, Zhaojie Pan, Naoto Yokoya, Jocelyn Chanussot

机构 * Southeast University(东南大学) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) College of Resources and Environment, University of Chinese Academy of Sciences(中国科学院大学资源与环境学院) School of Mathematics, Southeast University(东南大学数学学院) Department of Complexity Science and Engineering, Graduate School of Frontier Sciences, the University of Tokyo(东京大学前沿科学研究院复杂科学与工程部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、Inria、CNRS、Grenoble INP、LJK)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MambaX通过动态状态预测控制和多模态融合方法提升图像超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17576 2025-11-25 cs.CV cs.AI cs.LG 57%

Multimodal AI for Body Fat Estimation: Computer Vision and Anthropometry with DEXA Benchmarks

多模态AI用于脂肪率估计:计算机视觉与体态测量结合DEXA基准测试

Rayan Aldajani

机构 * Dept. of Electrical Engineering and Computer Science(电气工程与计算机科学系) York University(约克大学) Toronto, Canada(加拿大多伦多)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出利用多模态AI结合计算机视觉和体态测量数据,通过DEXA基准测试验证了低成本脂肪率估计方法的有效性。

Comments 2 pages, 2 figures, accepted at IEEE CASCON 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17955 2025-11-25 cs.CL 50%

MTikGuard System: A Transformer-Based Multimodal System for Child-Safe Content Moderation on TikTok

MTikGuard系统:一种基于Transformer的多模态系统,用于TikTok上的儿童安全内容审核

Dat Thanh Nguyen, Nguyen Hung Lam, Anh Hoang-Thi Nguyen, Trong-Hop Do

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Faculty of Software Engineering, University of Information Technology(软件工程学院,信息科技大学) Faculty of Computer Science, University of Information Technology(计算机科学学院,信息科技大学) University of Information Technology, Ho Chi Minh City(信息科技大学,胡志明市) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 MTikGuard系统通过多模态分类框架和扩展数据集,实现TikTok儿童安全内容审核的高准确率和实时部署。

Comments Accepted at PACLIC39

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17587 2025-11-25 cs.LG cs.AI 50%

Emotion and Intention Guided Multi-Modal Learning for Sticker Response Selection

基于情感与意图引导的多模态学习用于贴纸响应选择

Yuxuan Hu, Jian Chen, Yuhao Wang, Zixuan Li, Jing Xiong, Pengyue Jia, Wei Wang, Chengming Li, Xiangyu Zhao

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文提出EIGML框架,通过联合建模情感与意图,提升贴纸响应选择的准确性和理解深度。

详情

展开后加载摘要…

URL PDF HTML 收藏