arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-29 至 2025-12-29 共收录 9 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 4 篇

2512.21495 2025-12-29 cs.CV 88%

Generative Multi-Focus Image Fusion

生成式多焦点图像融合

Xinzhe Xie, Buyu Guo, Bolin Li, Shuangyan He, Yanzhen Gu, Qingyan Jiang, Peiliang Li

机构 * State Key Laboratory of Ocean Sensing & Ocean College, Zhejiang University(海洋传感国家重点实验室与海洋学院,浙江大学) Donghai Laboratory(东海实验室) Hainan Institute, Zhejiang University(海南学院,浙江大学) Hainan Provincial Observatory of Ecological Environment and Fishery Resource in Yazhou Bay(三亚市生态环境与渔业资源省级观测站)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-focus(title,abstract);分类 cs.CV

AI总结 本文提出GMFF框架,通过确定性融合和生成式修复两个阶段,实现高效多焦点图像融合,解决边缘伪影问题并提升实际应用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21544 2025-12-29 cs.LG 71%

AVP-Fusion: Adaptive Multi-Modal Fusion and Contrastive Learning for Two-Stage Antiviral Peptide Identification

AVP-Fusion:适应性多模态融合与对比学习用于两阶段抗病毒肽识别

Xinru Wen, Weizhong Lin, Xuan Xiao

专题命中 通用Image Fusion :multi-modal fusion(title)

AI总结 AVP-Fusion通过自适应多模态融合与对比学习,实现了抗病毒肽的两阶段高效识别,显著提升准确率和决策边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21861 2025-12-29 cs.CV cs.AI cs.LG 57%

Balancing Accuracy and Efficiency: CNN Fusion Models for Diabetic Retinopathy Screening

在准确性和效率之间平衡:用于糖尿病视网膜病变筛查的CNN融合模型

Md Rafid Islam, Rafsan Jany, Akib Ahmed, Mohammad Ashrafuzzaman Khan

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) North South University(北南大学) Digital Health Research Division(数字健康研究部) Korea Institute of Oriental Medicine(韩国东方医学研究院) Department of Computer Science(计算机科学系) American International University--Bangladesh(美国国际大学-孟加拉国)

专题命中 通用Image Fusion :feature-level fusion(abstract);分类 cs.CV

AI总结 本研究提出通过特征级融合提升糖尿病视网膜病变筛查的准确性和效率,采用EfficientNet-B0和DenseNet121的融合模型在准确率和延迟之间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21641 2025-12-29 cs.CV cs.AI 57%

TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References

TrackTeller: 基于时间的多模态3D定位用于行为依赖的对象引用

Jiahong Yu, Ziqi Wang, Hailiang Zhao, Wei Zhai, Xueqiang Yan, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 TrackTeller通过融合LiDAR图像、语言条件解码和时间推理,提升动态3D场景中基于语言的物体定位与跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2507.20146 2025-12-29 cs.CV 79%

AlignFreeNet: Is Cross-Modal Pre-Alignment Necessary? An End-to-End Alignment-Free Lightweight Network for Visible-Infrared Object Detection

AlignFreeNet: 跨模态预对齐是否必要?一种端到端无对齐的轻量级网络用于可见-红外目标检测

Dingkun Zhu, Haote Zhang, Lipeng Gu, Wuzhou Quan, Fu Lee Wang, Honghui Fan, Jiali Tang, Haoran Xie, Xiaoping Zhang, Mingqiang Wei

机构 * School of Computer Science, Jiangsu University of Technology(江苏科技大学计算机科学学院) School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院) School of Data Science, Lingnan University(岭南大学数据科学学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 AlignFreeNet通过无对齐融合范式,提出VCC和FCF模块,有效缓解可见-红外目标检测中的跨模态错位问题,实现端到端轻量级网络的高鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 4 篇

2512.21916 2025-12-29 cs.CV 57%

Patch as Node: Human-Centric Graph Representation Learning for Multimodal Action Recognition

补丁作为节点:面向多模态动作识别的人本图表示学习

Zeyu Liang, Hailun Xia, Naichuan Zheng

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出PAN框架,通过人本图表示学习提升多模态动作识别性能,结合双路径和统一网络结构实现高效融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21476 2025-12-29 cs.CV cs.AI 57%

GPF-Net: Gated Progressive Fusion Learning for Polyp Re-Identification

GPF-Net:门控渐进融合学习用于息肉重识别

Suncheng Xiang, Xiaoyang Wang, Junjie Jiang, Hejia Wang, Dahong Qian

机构 * Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Fifth People's Hospital(上海第五人民医院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 GPF-Net通过门控渐进融合学习提升息肉重识别性能,结合多模态融合策略优于现有单模态模型。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22102 2025-12-29 cs.LG 50%

Explainable Multimodal Regression via Information Decomposition

通过信息分解实现可解释的多模态回归

Zhaozhao Ma, Shujian Yu

机构 * Zhejiang University(浙江大学) Georgia Institute of Technology(佐治亚理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) UiT - The Arctic University of Norway(挪威北极大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出基于部分信息分解的多模态回归框架,通过分解模态特定表示为唯一、冗余和协同组件,提升预测准确性和可解释性,并在多个数据集上验证其有效性。

Comments Project Page: https://github.com/zhaozhaoma/PIDReg

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21543 2025-12-29 cs.IR 50%

CEMG: Collaborative-Enhanced Multimodal Generative Recommendation

CEMG: 基于协作增强的多模态生成推荐

Yuzhen Lin, Hongyi Chen, Xuanjing Chen, Shaowen Wang, Ivonne Xu, Dongming Jiang

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 CEMG通过多模态融合层和残差量化变分自编码器,提升多模态生成推荐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏