arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-11-25 至 2025-11-25 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 7 篇

2401.00728 2025-11-25 eess.IV cs.CV cs.LG 81%

MultiFusionNet: Multilayer Multimodal Fusion of Deep Neural Networks for Chest X-Ray Image Classification

MultiFusionNet:多层多模态融合的深度神经网络用于胸部X光图像分类

Saurabh Agarwal, K. V. Arya, Yogesh Kumar Meena

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV、eess.IV

AI总结 MultiFusionNet通过多层多模态融合和FDSFM模块提升胸部X光图像分类的准确率,达到97.21%和99.60%

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17965 2025-11-25 cs.CV cs.MM 62%

Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification

信号:选择性交互与全局-局部对齐用于多模态对象重识别

Yangyang Liu, Yuhao Wang, Pingping Zhang

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV、cs.MM

AI总结 Signal通过选择性交互和全局-局部对齐框架提升多模态对象重识别的性能。

Comments Accepted by AAAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18865 2025-11-25 cs.CV 57%

DualGazeNet: A Biologically Inspired Dual-Gaze Query Network for Salient Object Detection

DualGazeNet: 一种生物启发的双目注视查询网络用于显著物体检测

Yu Zhang, Haoan Ping, Yuchen Li, Zhenshan Bing, Fuchun Sun, Alois Knoll

机构 * School of Computation, Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学) Department of Informatics, Technical University of Munich(信息学院,慕尼黑技术大学) University Research and Innovation Center, Obuda University(奥布达大学研究与创新中心) State Key Laboratory for Novel Software Technology, Nanjing University Suzhou Campus(新型软件技术国家重点实验室,南京大学苏州校区) School of Science and Technology, Nanjing University Suzhou Campus(科学与技术学院,南京大学苏州校区) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 DualGazeNet通过生物启发的纯Transformer框架,实现了显著物体检测的高效准确性和计算效率,超越了多种现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18028 2025-11-25 cs.CV 57%

MambaX: Image Super-Resolution with State Predictive Control

MambaX:基于状态预测控制的图像超分辨率

Chenyu Li, Danfeng Hong, Bing Zhang, Zhaojie Pan, Naoto Yokoya, Jocelyn Chanussot

机构 * Southeast University(东南大学) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) College of Resources and Environment, University of Chinese Academy of Sciences(中国科学院大学资源与环境学院) School of Mathematics, Southeast University(东南大学数学学院) Department of Complexity Science and Engineering, Graduate School of Frontier Sciences, the University of Tokyo(东京大学前沿科学研究院复杂科学与工程部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、Inria、CNRS、Grenoble INP、LJK)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MambaX通过动态状态预测控制和多模态融合方法提升图像超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17576 2025-11-25 cs.CV cs.AI cs.LG 57%

Multimodal AI for Body Fat Estimation: Computer Vision and Anthropometry with DEXA Benchmarks

多模态AI用于脂肪率估计:计算机视觉与体态测量结合DEXA基准测试

Rayan Aldajani

机构 * Dept. of Electrical Engineering and Computer Science(电气工程与计算机科学系) York University(约克大学) Toronto, Canada(加拿大多伦多)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出利用多模态AI结合计算机视觉和体态测量数据,通过DEXA基准测试验证了低成本脂肪率估计方法的有效性。

Comments 2 pages, 2 figures, accepted at IEEE CASCON 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17955 2025-11-25 cs.CL 50%

MTikGuard System: A Transformer-Based Multimodal System for Child-Safe Content Moderation on TikTok

MTikGuard系统:一种基于Transformer的多模态系统,用于TikTok上的儿童安全内容审核

Dat Thanh Nguyen, Nguyen Hung Lam, Anh Hoang-Thi Nguyen, Trong-Hop Do

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Faculty of Software Engineering, University of Information Technology(软件工程学院,信息科技大学) Faculty of Computer Science, University of Information Technology(计算机科学学院,信息科技大学) University of Information Technology, Ho Chi Minh City(信息科技大学,胡志明市) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 MTikGuard系统通过多模态分类框架和扩展数据集,实现TikTok儿童安全内容审核的高准确率和实时部署。

Comments Accepted at PACLIC39

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17587 2025-11-25 cs.LG cs.AI 50%

Emotion and Intention Guided Multi-Modal Learning for Sticker Response Selection

基于情感与意图引导的多模态学习用于贴纸响应选择

Yuxuan Hu, Jian Chen, Yuhao Wang, Zixuan Li, Jing Xiong, Pengyue Jia, Wei Wang, Chengming Li, Xiangyu Zhao

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文提出EIGML框架,通过联合建模情感与意图,提升贴纸响应选择的准确性和理解深度。

详情

展开后加载摘要…

URL PDF HTML 收藏