arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-25 至 2026-08-25 共收录 10 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2608.21786 2026-08-25 cs.CV 新提交 79%

HP-UniIF: Hierarchical Prompt Learning for Unified Image Fusion

HP-UniIF:用于统一图像融合的分层提示学习

Xingxin Xu, Siqi Zhao, Xin Li, Xinjie Yao, Yiming Sun, Pengfei Zhu

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV

AI总结 HP-UniIF是一种基于分层条件调制策略的统一视觉框架,利用扩散先验实现异构图像融合、视觉恢复与下游感知的协同,在多任务实验中表现出优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 3 篇

2608.21433 2026-08-25 cs.RO eess.SY 新提交 79%

The Setting of IMU Parameters in Kalman Filtering-based Information Fusion

基于卡尔曼滤波的信息融合中惯性测量单元(IMU)参数的设置

Qiang Hu, Yanhua Zou, Shuaiyi Huo, Haibo Ge, Wei Ouyang

机构 * Tongji University(同济大学)

专题命中 机器人多传感器融合 :information fusion(title);sensor fusion(abstract);分类 cs.RO

AI总结 该研究针对卡尔曼滤波信息融合中IMU参数设置难题,提出基于Allan方差校准的方法,验证了其在两类IMU传感器融合系统中的可行性与有效性。

Comments 2026 International Conference on Guidance, Navigation and Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22023 2026-08-25 cs.LG 新提交 71%

Spectral Pre-Filtering for Context-Adaptive Sensor Fusion: A Four-Role FFT-GDCB Integration for High-Stakes Decision Systems

面向高风险决策系统的上下文自适应传感器融合的谱预滤波:FFT-GDCB四角色集成方案

Oleg Miroshnichenko

专题命中 机器人多传感器融合 :sensor fusion(title)

AI总结 本研究针对传感器融合中周期性结构污染导致的卡尔曼滤波器协方差校准问题,提出FFT-GDCB四角色预滤波方案,在六个领域验证其性能且计算开销极低。

Comments 15 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21699 2026-08-25 cs.RO 新提交 57%

Towards insect-like distributed proprioception in actuators and appendages for flapping-wing insect-scale aerial robots

面向扑翼昆虫级空中机器人的作动器与附肢中类昆虫分布式本体感知

Alexander Hedrick, Arvind Gupta, Kaushik Jayaram

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Imperial College London(帝国理工学院)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 该研究针对扑翼昆虫级空中机器人,开发了两种嵌入式本体感知传感器,可精准跟踪冲程与俯仰角,实现碰撞检测与异步扑翼,有望提升机器人性能。

Comments 8 pages, 6 figures, this work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 4 篇

2607.16327 2026-08-25 cs.CV 版本更新 70%

Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation

用于文本引导医学图像分割的定位注入视觉语言语义融合

Songyue Han, Mingye Zou, Shuchang Ye, Lei Bi, Mingyuan Meng

机构 * Air Force Engineering University(空军工程大学) Harbin Institute of Technology(哈尔滨工业大学) University of Sydney(悉尼大学) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 音视频/视觉语言融合 :information fusion(abstract);feature-level fusion(abstract);分类 cs.CV

AI总结 研究针对文本引导医学图像分割,提出LoG框架,通过联合执行多尺度目标定位任务,实现三级定位注入语义融合,在三个基准数据集实验中表现出色,优于现有医学图像分割方法。

Comments 12 pages, 6 figures, 7 tables. v2: revised presentation with updated author affiliations; abstract condensed; Figure 1 redrawn; an average performance column added to Table I; one reference added and three removed; author biographies removed. All datasets, methods and experimental results are unchanged from v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23102 2026-08-25 cs.CV cs.IR 新提交 57%

Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models

无需训练的伪融合:基于扩散模型和多模态大语言模型的组合图像检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出无需训练的PeFuse伪融合框架,结合扩散模型与多模态大语言模型,将组合图像检索转化为单模态检索任务,在零样本场景下实现了媲美当前最优方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11269 2026-08-25 cs.CV cs.HC 版本更新 57%

Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment

特质更深:面向人格评估的特质特异性非对称融合

Jia Li, Qian Chen, Wei Wang, Xinyu Li, Zhenzhen Hu, Dongsheng Shao, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) Jianghuai Advanced Technology Center(江淮前沿技术中心) Anhui Provincial Industry Innovation Center of Humanoid Robots(安徽省人形机器人产业创新中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出Traits Run Deeper框架,通过多模态基础表示、特质特异性非对称融合和分布校准回归模块,解决人格评估中模态偏好差异和标签偏差问题,在AVI Challenge 2026上MSE降低约25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17681 2026-08-25 cs.CV 版本更新 57%

Motion-Aware Vision-Reference Alignment for Referring Multi-Object Tracking

基于多模态大语言模型的视觉-运动-参考对齐的指称多目标跟踪

Weiyi Lv, Ning Zhang, Hanyang Sun, Haoran Jiang, Kai Zhao, Yixiao Gu, Jing Xiao, Dan Zeng

机构 * Shanghai University(上海大学) PAII Inc.(PAII公司)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 VMRMOT通过多模态大语言模型实现视觉-运动-参考对齐,提升指称多目标跟踪的性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 2 篇

2608.02092 2026-08-25 cs.CV cs.MM 版本更新 84%

Deep Multimodal Fusion Detection through Spatial Mask and Channel Competition

基于空间掩码与通道融合的深度多模态融合检测

Guandi Wang, Ming Li, Yunsen Xing, Junle Liu

机构 * KTH Royal Institute of Technology(KTH皇家理工学院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);feature-level fusion(abstract);分类 cs.CV、cs.MM

AI总结 本文针对现有多模态融合检测的过拟合问题,提出Attention-Driven Complementarity Resampling框架,通过语义掩码交换与可学习通道竞争实现跨模态目标检测的性能提升,在多数据集上取得了有竞争力的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21797 2026-08-25 cs.LG cs.AI cs.SD eess.AS 版本更新 78%

Mitigating Sample-Level Imbalance via Probabilistic Separation for Adaptive Multimodal Fusion

量化多模态不平衡:一种基于GMM的自适应损失用于音频-视觉学习

Zhiwen Yu, Zhaocheng Liu, Xiaoqing Liu, Huanqiang Zeng, C. L. Philip Chen

机构 * South China University of Technology(南方科技大学)

专题命中 融合架构与评测 :multimodal fusion(title,abstract)

AI总结 本文提出基于GMM的自适应损失,用于量化和缓解多模态学习中的样本级不平衡问题,通过双阶段框架提升音频-视觉学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏