arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-16 至 2025-12-16 共收录 10 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 多聚焦/多曝光融合 1 篇

2212.14801 2025-12-16 cs.CV 57%

ExReg: Wide-range Photo Exposure Correction via a Multi-dimensional Regressor with Attention

ExReg:通过带有注意力机制的多维回归器实现宽范围照片曝光校正

Huu-Phu Do, Hao-Chien Hsueh, Tzu-Hao Chiang, Chi-Han Chen, Wen-Hsiao Peng, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV

AI总结 ExReg通过多维回归和注意力机制,解决宽范围照片曝光校正问题,实现高效且准确的曝光调整。

Comments Accepted by ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 2 篇

2503.23445 2025-12-16 cs.RO cs.IR 79%

Design and Experimental Validation of an Autonomous USV for Sensor Fusion-Based Navigation in GNSS-Denied Environments

面向GNSS拒止环境的自主水下无人艇设计与实验验证

Samuel Cohen-Salmon, Itzik Klein

机构 * The Hatter Department of Marine Technologies, Charney School of Marine Sciences, University of Haifa, Israel(海洋技术系、海洋科学学院、海法大学,以色列)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 cs.RO

AI总结 本文提出了一种面向GNSS拒止环境的自主无人艇,通过模块化设计和传感器融合技术实现导航算法的实测验证。

Comments submitted to IEEE OCEANS 2025 Brest

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12474 2025-12-16 eess.SY cs.AI cs.LG cs.SY 78%

AI-Driven Real-Time Kick Classification in Olympic Taekwondo Using Sensor Fusion

基于AI的奥运跆拳道实时踢击分类技术:传感器融合应用

Jamsheed Mistri

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract)

AI总结 本文提出基于AI和传感器融合的实时踢击分类系统,通过改进评分标准提升跆拳道比赛的动态性和观赏性。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 4 篇

2511.22447 2025-12-16 cs.MM 57%

Angle-Optimized Partial Disentanglement for Multimodal Emotion Recognition in Conversation

对话中多模态情感识别的视角优化部分解耦

Xinyi Che, Wenbo Wang, Yuanbo Hou, Mingjie Xie, Qijun Zhao, Jian Guan

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 本文提出AO-FL框架,通过自适应角度优化实现对话中多模态情感识别的共享与特定特征部分解耦,提升情感识别性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11901 2025-12-16 cs.CV cs.LG 57%

CLARGA: Multimodal Graph Representation Learning over Arbitrary Sets of Modalities

CLARGA:任意模态集合上的多模态图表示学习

Santosh Patapati

机构 * Santosh Patapati(独立研究者)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 CLARGA是一种通用的多模态融合架构,通过构建注意力加权图实现多模态表示学习,适用于任意模态集合,具有高效的融合能力和良好的鲁棒性。

Comments WACV; Supplementary material is available on CVF proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23316 2025-12-16 cs.CV 57%

C3-OWD: A Curriculum Cross-modal Contrastive Learning Framework for Open-World Detection

C3-OWD: 一种用于开放世界检测的课程跨模态对比学习框架

Siheng Wang, Zhengdao Li, Yanshu Li, Canran Xiao, Haibo Zhan, Zhengtao Yao, Xuzhi Zhang, Jiale Kang, Linshan Li, Weiming Liu, Zhikang Dong, Jifeng Shen, Junhao Dong, Qiang Sun, Piotr Koniusz

专题命中 音视频/视觉语言融合 :visible-infrared(abstract);分类 cs.CV

AI总结 C3-OWD提出一种课程跨模态对比学习框架,通过预训练和视觉-语言对齐提升目标检测的鲁棒性和泛化能力。

Comments one of the authors doesn't agree any more

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06940 2025-12-16 cs.CV 57%

CineBrain: A Large-Scale Multi-Modal Brain Dataset During Naturalistic Audiovisual Narrative Processing

CineBrain: 一种大规模多模态大脑数据集用于自然视听叙事处理

Jianxiong Gao, Yichang Liu, Baofeng Yang, Jianfeng Feng, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 CineBrain通过多模态融合编码器和神经潜在解码器实现动态视频重建,利用fMRI和EEG互补优势提升视觉保真度,并揭示听觉输入对视觉感知的影响。

Comments Project Page: https://jianxgao.github.io/CineBrain

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 3 篇

2512.13191 2025-12-16 cs.CV 79%

CoRA: A Collaborative Robust Architecture with Hybrid Fusion for Efficient Perception

CoRA: 一种具有混合融合的协作鲁棒架构以实现高效的感知

Gong Chen, Chaokun Zhang, Pengcheng Lv, Xiaohui Xie

专题命中 融合架构与评测 :hybrid fusion(title);feature-level fusion(abstract);分类 cs.CV

AI总结 CoRA通过混合融合方法实现高效且鲁棒的协作感知,显著提升性能并降低通信开销。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15497 2025-12-16 eess.SP 57%

A Review of Machine Learning for Cavitation Intensity Recognition in Complex Industrial Systems

机械系统中空化强度识别的机器学习综述

Yu Sha, Ningtao Liu, Haofeng Liu, Junqi Tao, Zhenxing Niu, Guojun Huang, Yao Yao, Jiaqi Liang, Moxian Qian, Horst Stoecker, Domagoj Vnucec, Andreas Widl, Kai Zhou

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 eess.SP

AI总结 本文综述了机械系统中空化强度识别的机器学习发展,强调传统方法与深度学习的演变,并展望未来在多源数据处理和工业应用中的发展方向。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13396 2025-12-16 cs.IR 50%

Automated Information Flow Selection for Multi-scenario Multi-task Recommendation

多场景多任务推荐的自动化信息流选择

Chaohua Yang, Dugang Liu, Shiwei Li, Yuwen Fu, Xing Tang, Weihong Luo, Xiangyu Zhao, Xiuqiang He, Zhong Ming

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 本文提出AutoIFS框架,通过低秩适应和信息流选择网络,解决多场景多任务推荐中信息融合复杂和噪声问题,提升模型性能。

Comments 10 Pages, 6 Figures, WSDM 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏