Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion
实体引导的多任务学习用于红外和可见图像融合
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。
Comments Accepted by IEEE Transactions on Multimedia
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
实体引导的多任务学习用于红外和可见图像融合
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。
Comments Accepted by IEEE Transactions on Multimedia
一种互结构加权的子像素多模光学遥感图像匹配方法
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于相位一致性互结构加权的子像素多模光学遥感图像匹配方法,通过粗到细的框架提升匹配精度,实测平均精度达0.4像素。
揭示心脑联系:对认知表现中ECG的分析
机构 * Digital University Kerala(数字大学凯拉尔) ; Centre for Consciousness Studies, NIMHANS(意识研究中心,NIMHANS)
专题命中 其他多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 本文通过ECG信号分析认知负荷,提出跨模态XGBoost框架实现EEG代表性认知空间投影,验证ECG在日常认知监测中的可行性。
Comments 6 pages, 6 figures. Code available at https://github.com/AkshaySasi/Unveiling-the-Heart-Brain-Connection-An-Analysis-of-ECG-in-Cognitive-Performance. Presented at AIHC (not published)
从透视变形文档中提取结构化数据的鲁棒性
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
AI总结 本研究探讨了透视变形对多模态LLMs提取文档数据准确性的影响,发现结构识别准确性显著下降,但可通过旋转校正提升。
Comments 8 pages, 12 figures
Journal ref 2025 10th International Conference on Intelligent Informatics and Biomedical Sciences (ICIIBMS), Okinawa, Japan, 2025, pp. 1-8
CORE: 基于代码的逆向自训练框架与图扩展用于虚拟代理
机构 * Zhejiang University(浙江大学) ; Wuhan University(武汉大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 CORE提出一种基于代码的逆向自训练框架,通过语义代码抽象和策略图扩展,提升虚拟代理的行为多样性和泛化能力。
Comments 19 pages, 12 figures
BARE:面向偏见意识和推理增强的单塔视觉定位
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Pengcheng Laboratory(鹏城实验室) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 BARE通过引入三个新模块,提升单塔视觉定位任务中对偏见的意识和推理能力,实现更高效和准确的多模态理解。
机器人如何看见不可见之物:通过窥视提升探索机器人视觉可解释性
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 通过模仿昆虫的窥视动作,提升探索机器人在部分遮挡下的视觉推理能力,实现高分辨率、实时感知,适用于复杂环境导航与场景理解。