arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-01 至 2025-12-01 共收录 11 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 2 篇

2402.16267 2025-12-01 cs.CV 86%

Infrared and Visible Image Fusion with Language-Driven Loss in CLIP Embedding Space

红外与可见图像融合中的语言驱动损失在CLIP嵌入空间中

Yuhao Wang, Lingjuan Miao, Zhiqiang Zhou, Lei Zhang, Yajun Qiao

机构 * School of Automation\ Institute of Technology Beijing China School of Automation\ Institute of Technology

专题命中 红外-可见光融合 :image fusion(title,abstract);infrared and visible(title);分类 cs.CV

AI总结 本文提出一种基于语言驱动损失的IVIF方法,利用CLIP嵌入空间实现融合目标与输入图像模态的关系建模,提升融合性能。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22896 2025-12-01 cs.CV 57%

DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking

DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li

机构 * China Agricultural University(中国农业大学) Beijing Normal University(北京师范大学)

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 2 篇

2506.11764 2025-12-01 cs.CV eess.IV 62%

DiffFuSR: Super-Resolution of all Sentinel-2 Multispectral Bands using Diffusion Models

DiffFuSR:利用扩散模型实现所有Sentinel-2多光谱波段的超分辨率处理

Muhammad Sarmad, Arnt-Børre Salberg, Michael Kampffmeyer

机构 * Norwegian Computing Center(挪威计算中心) Department of Physics and Technology, UiT The Arctic University of Norway(物理与技术系,UiT 北极大学)

专题命中 遥感融合与全色锐化 :pansharpening(abstract);分类 cs.CV、eess.IV

AI总结 DiffFuSR通过扩散模型和融合策略实现Sentinel-2多光谱波段的超分辨率处理,提升反射率保真度和光谱一致性。

Comments Accepted for Publication at IEEE TRANSACTIONS ON GEOSCIENCE AND REMOTE SENSING (TGRS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22668 2025-12-01 astro-ph.IM astro-ph.EP cs.CV 57%

Structure-Preserving Unpaired Image Translation to Photometrically Calibrate JunoCam with Hubble Data

保持结构的未配对图像翻译以利用哈勃数据校准朱诺相机

Aditya Pratap Singh, Shrey Shah, Ramanakumar Sankar, Emma Dahl, Gerald Eichstädt, Georgios Georgakis, Bernadette Bucher

专题命中 遥感融合与全色锐化 :pansharpening(abstract);分类 cs.CV

AI总结 本文提出了一种保持结构的未配对图像翻译方法,用于利用哈勃数据校准朱诺相机,以解决分辨率差异问题并提升遥感数据处理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 1 篇

2509.08095 2025-12-01 cs.RO cs.AI 74%

Real-Time Obstacle Avoidance for a Mobile Robot Using CNN-Based Sensor Fusion

基于CNN传感器融合的移动机器人实时障碍规避

Lamiaa H. Zain

机构 * School of Engineering(工程学院) Applied Science SESC Research Center, MECT Program(应用科学SESC研究中心,MECT项目) Nile University(尼罗大学) Giza, Egypt(埃及吉兹)

专题命中 机器人多传感器融合 :sensor fusion(title);分类 cs.RO

AI总结 本文提出基于CNN的传感器融合方法,用于移动机器人在复杂环境中实时规避障碍,NetConEmb模型在精度和鲁棒性上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 2 篇

2511.22103 2025-12-01 cs.CV 57%

MoE3D: Mixture of Experts meets Multi-Modal 3D Understanding

MoE3D:专家混合方法与多模态3D理解

Yu Li, Yuenan Hou, Yingmei Wei, Xinge Zhu, Yuexin Ma, Wenqi Shao, Yanming Guo

机构 * National University of Defense Technology(国防科技大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) ShanghaiTech University(上海科技大学)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 MoE3D通过整合专家混合方法,提升多模态3D理解的性能,尤其在Multi3DRefer任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD 57%

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);分类 cs.MM

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 4 篇

2407.00964 2025-12-01 eess.SP 83%

Multi-Modal Fusion-Based Multi-Task Semantic Communication System

基于多模态融合的多任务语义通信系统

Zengle Zhu, Rongqing Zhang, Xiang Cheng, Liuqing Yang

专题命中 融合架构与评测 :multi-modal fusion(title,abstract);information fusion(abstract);分类 eess.SP

AI总结 本文提出基于多模态融合的多任务语义通信系统,利用BERT融合模块提升多模态信息处理效率,实验表明其在性能和通信开销上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23026 2025-12-01 cs.CR cs.GT cs.MA 78%

A Game-Theoretic Approach for Adversarial Information Fusion in Distributed Sensor Networks

对抗信息融合在分布式传感器网络中的博弈论方法

Kassem Kallas

专题命中 融合架构与评测 :information fusion(title,abstract)

AI总结 本研究提出博弈论方法,用于解决分布式传感器网络中对抗信息融合问题,通过软隔离防御、最优决策融合策略、近似最优消息传递算法和数据篡改防御机制,提升系统安全性。

Comments My PhD Thesis in Information Engineering and Sciences defended at University of Siena in Italy in 2017 under the supervision of Professor Mauro Barni

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22404 2025-12-01 cs.CV 57%

UAV-MM3D: A Large-Scale Synthetic Benchmark for 3D Perception of Unmanned Aerial Vehicles with Multi-Modal Data

UAV-MM3D: 一种大规模合成基准,用于多模态数据下的无人机三维感知

Longkun Zou, Jiale Wang, Rongqin Liang, Hai Wu, Ke Chen, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) University of Southern California(南加州大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 UAV-MM3D通过多模态合成数据提升无人机三维感知能力,提供高保真数据集和多任务基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21937 2025-12-01 cs.CV 57%

Interpretable Multimodal Cancer Prototyping with Whole Slide Images and Incompletely Paired Genomics

可解释的多模态癌症原型生成:结合整张滑片图像与不完全配对的基因组学

Yupei Zhang, Yating Huang, Wanming Hu, Lequan Yu, Hujun Yin, Chao Li

机构 * Department of Clinical Neurosciences, University of Cambridge, UK(剑桥大学临床神经科学系) Department of Electrical & Electronic Engineering, The University of Manchester, UK(曼彻斯特大学电气与电子工程系) Department of Pathology, State Key Laboratory of Oncology in South China, Guangdong Provincial Clinical Research Center for Cancer, Sun Yat-sen University Cancer Center, China(南方医科大学肿瘤学国家重点实验室、广东省癌症临床研究中心、中山大学肿瘤中心病理学部) Department of Statistics and Actuarial Science, The University of Hong Kong, Hong Kong SAR, China(香港大学统计与精算科学系) Department of Clinical Neurosciences and Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学临床神经科学系和应用数学与理论物理系;邓迪大学科学与工程学院和医学学院) School of Science and Engineering and School of Medicine, University of Dundee, UK

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出了一种可解释的多模态原型生成框架,通过整合整张滑片图像和不完整的基因组学数据,提升精准肿瘤学中的多模态整合效果。

详情

展开后加载摘要…

URL PDF HTML 收藏