arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 1417 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1417 篇

2503.15625 2026-03-09 cs.CV 57%

EarthScape: A Multimodal Dataset for Surficial Geologic Mapping and Earth Surface Analysis

EarthScape:一种用于地表地质制图和地表分析的多模态数据集

Matthew Massey, Nusrat Munia, Abdullah-Al-Zubaer Imran

机构 * Kentucky Geological Survey(肯塔基地质调查局) University of Kentucky(肯塔基大学) Department of Computer Science(计算机科学系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 EarthScape是一种用于地表地质制图和地表分析的多模态数据集,通过整合多种数据源提供统一的基准测试平台,提升多模态融合和领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07080 2026-03-06 cs.CV 57%

FLAIR-HUB: Large-scale Multimodal Dataset for Land Cover and Crop Mapping

FLAIR-HUB:大规模多模态数据集用于土地覆盖和作物制图

Anatol Garioud, Sébastien Giordano, Nicolas David, Nicolas Gonthier

机构 * Institut national de l’information géographique et forestière (IGN), France(法国国家地理与森林信息研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 FLAIR-HUB是一个大规模多模态数据集,用于提升土地覆盖和作物制图的准确性,通过多模态融合和深度学习模型实现高精度分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04887 2026-03-06 cs.CV 57%

Federated Modality-specific Encoders and Partially Personalized Fusion Decoder for Multimodal Brain Tumor Segmentation

联邦模态特定编码器和部分个性化融合解码器用于多模态脑肿瘤分割

Hong Liu, Dong Wei, Qian Dai, Xian Wu, Yefeng Zheng, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine(国家医学数据科学研究院) Department of Computer Science at School of Informatics(信息学院计算机科学系) Jarvis Research Center(Jarvis研究中心) Medical Artificial Intelligence Lab(医学人工智能实验室)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出FedMEPD框架,通过联邦模态特定编码器和部分个性化融合解码器,解决多模态医学图像分析中的模态间异质性和个性化需求问题。

Comments Medical Image Analysis 2025. arXiv admin note: substantial text overlap with arXiv:2403.11803

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03615 2026-03-05 cs.CV 57%

Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression

视差对齐所有内容:一种用于分布式多视图图像压缩的 OmniParallax 注意机制

Haotian Zhang, Feiyue Long, Yixin Yu, Jian Xue, Haocheng Tang, Tongda Xu, Zhenning Shi, Yan Wang, Siwei Ma, Jiaqi Zhang

机构 * The National Engineering Laboratory for Video Technology, School of Computer Science, Peking University(国家视频技术工程实验室,计算机科学学院,北京大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 ParaHydra通过OmniParallax注意机制和多信息融合模块,实现了分布式多视图图像压缩的高效编码与解码,显著提升压缩效率并降低计算开销

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03544 2026-03-05 cs.CV 57%

PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest

PinCLIP:Pinterest的规模化多模态基础表示

Josh Beal, Eric Kim, Jinfeng Rao, Rex Wu, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest Inc.(Pinterest公司)

专题命中 融合架构与评测 :hybrid fusion(abstract);分类 cs.CV

AI总结 PinCLIP通过多模态表示学习提升Pinterest的检索和排序模型,解决冷启动问题并提高用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01404 2026-03-04 cs.RO 57%

D-GVIO: A Buffer-Driven and Efficient Decentralized GNSS-Visual-Inertial State Estimator for Multi-Agent Systems

D-GVIO: 一种基于缓冲的高效分布式GNSS-视觉-惯性状态估计器用于多智能体系统

Yarong Luo, Wentao Lu, Chi Guo, Ming Li

机构 * School of Robotics, Wuhan University(机器人学院,武汉大学) School of Electronic Information of Wuhan University, Hubei Luojia Laboratory(武汉大学电子信息学院,湖北珞珈实验室)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.RO

AI总结 D-GVIO通过基于缓冲的分布式框架和L-IEKF实现高效鲁棒的GNSS-视觉-惯性状态估计,适用于多智能体系统的协同定位任务。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23699 2026-03-02 cs.CV cs.CL 57%

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

HiDrop:通过晚期注入、凹形金字塔剪枝和早期退出实现MLLM中的层次视觉令牌减少

Hao Wu, Yingqi Fan, Jinyang Dai, Junlong Tong, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习中心,慕尼黑大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 HiDrop通过晚期注入、凹形金字塔剪枝和早期退出机制,实现多模态大语言模型中视觉令牌的高效减少,提升训练效率并保持性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06450 2026-02-24 cs.CV cs.LG 57%

Countering Multi-modal Representation Collapse through Rank-targeted Fusion

通过秩目标融合对抗多模态表示崩溃

Seulgi Kim, Kiran Kokilepersaud, Mohit Prabhushankar, Ghassan AlRegib

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出Rank-enhancing Token Fuser框架,通过提升有效秩对抗多模态表示崩溃,验证了深度与RGB融合的平衡性,并在动作预测任务中取得显著性能提升。

Comments Accepted in 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16681 2026-02-19 cs.CV 57%

VETime: Vision Enhanced Zero-Shot Time Series Anomaly Detection

VETime: 基于视觉增强的零样本时间序列异常检测

Yingyuan Yang, Tian Lan, Yifei Gao, Yimeng Lu, Wenjun He, Meng Wang, Chenghao Liu, Chen Zhang

机构 * Department of Industrial Engineering, Tsinghua University, Beijing, China(清华大学工业工程系) Lab, Huawei Technologies Ltd, Beijing, China(华为技术有限公司2012实验室) Datadog AI Research(Datadog人工智能研究)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 VETime通过融合视觉与时间模态,提出零样本时间序列异常检测框架,实现高精度定位与低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12919 2026-02-16 cs.CV cs.AI cs.NE 57%

EPRBench: A High-Quality Benchmark Dataset for Event Stream Based Visual Place Recognition

EPRBench: 一种高质量的基于事件流的视觉位置识别基准数据集

Xiao Wang, Xingxing Xiong, Jinfeng Gao, Xufeng Lou, Bo Jiang, Si-bao Chen, Yaowei Wang, Yonghong Tian

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science, Peking University(北京大学计算机科学学院) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 EPRBench提出了一种高质量的基于事件流的视觉位置识别基准数据集,结合LLM生成场景描述与多模态融合方法,提升位置识别的准确性和模型透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10549 2026-02-12 cs.CV cs.AI 57%

Enhancing Weakly Supervised Multimodal Video Anomaly Detection through Text Guidance

通过文本引导增强弱监督多模态视频异常检测

Shengyang Sun, Jiashen Hua, Junyi Feng, Xiaojin Gong

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Alibaba Cloud(阿里云) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出文本引导框架,通过多阶段文本增强和多尺度瓶颈Transformer融合模块,提升弱监督多模态视频异常检测的性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00696 2026-02-03 eess.SP 57%

CMANet: Channel-Masked Attention Network for Cooperative Multi-Base-Station 3D Positioning

CMANet:基于合作多基站3D定位的通道掩码注意力网络

Tong An, Huan Lu, Jiayang Shi, Kai Yu, Rongrong Zhu, Bin Zheng, Jiwei Zhao, Haibo Zhou

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 eess.SP

AI总结 CMANet通过通道掩码注意力机制和轻量级LSTM解码器实现多基站协作的高精度3D定位,实验显示其在城市环境中具有优于现有方法的定位精度。

Comments 6pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00102 2026-02-03 eess.IV cs.AI cs.LG 57%

Radiomics in Medical Imaging: Methods, Applications, and Challenges

医学影像中的放射组学:方法、应用与挑战

Fnu Neha, Deepak kumar Shukla

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.IV

AI总结 本文系统分析了放射组学的全流程,探讨了特征稳定性、模型可靠性及临床转化有效性,并提出了标准化、领域转移和临床部署等未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22039 2026-01-30 cs.CV 57%

Understanding Multimodal Complementarity for Single-Frame Action Anticipation

理解单帧动作预测中的多模态互补性

Manuel Benavent-Lledo, Konstantinos Bacharidis, Konstantinos Papoutsakis, Antonis Argyros, Jose Garcia-Rodriguez

机构 * Department of Computer Technology, University of Alicante(阿尔瓦雷斯大学计算机技术系) Institute of Computer Science, FORTH(福蒂研究所) Computer Science Department, University of Crete(克里特大学计算机科学系) Department of Management, Science and Technology, Hellenic Mediterranean University(希腊地中海大学管理、科学与技术系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究通过单帧动作预测框架AAG+,探索多模态互补性对动作预测的影响,验证单帧信息在动作预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20547 2026-01-29 eess.SP 57%

Vehicular Wireless Positioning -- A Survey

车辆无线定位——综述

Sharief Saleh, Satyam Dwivedi, Russ Whiton, Peter Hammarberg, Musa Furkan Keskin, Julia Equi, Hui Chen, Florent Munier, Olof Eriksson, Fredrik Gunnarsson, Fredrik Tufvesson, Henk Wymeersch

专题命中 融合架构与评测 :sensor fusion(abstract);分类 eess.SP

AI总结 本文综述了车辆应用中无线定位技术的发展、现状及未来方向,涵盖卫星、蜂窝及IEEE标准技术,分析了定位需求、技术演变和传感器融合方法。

Comments Under review at IEEE Communications Surveys & Tutorials

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17041 2026-01-27 cs.CV cs.AI 57%

Arabic Sign Language Recognition using Multimodal Approach

阿拉伯手语识别的多模态方法

Ghadeer Alanazi, Abir Benabid

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出结合Leap Motion和RGB摄像头的多模态方法,用于提高阿拉伯手语识别的准确率,实验结果显示78%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16788 2026-01-26 cs.CV cs.AI 57%

REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusion

REL-SF4PASS:基于REL深度表示和球形融合的全景语义分割

Xuewei Li, Xinghan Bao, Zhimin Chen, Xi Li

机构 * School of Electronic and Information Engineering, Shanghai DianJi University(电子信息学院,上海电机大学) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 REL-SF4PASS通过REL深度表示和球形动态多模态融合方法,提升全景语义分割的性能和鲁棒性。

Comments submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19913 2026-01-26 cs.CV 57%

Coupled Physics-Gated Adaptation: Spatially Decoding Volumetric Photochemical Conversion in Complex 3D-Printed Objects

耦合物理门控适应:在复杂3D打印物体中空间解码体积分子转换

Maryam Eftekharifar, Churun Zhang, Jialiang Wei, Xudong Cao, Hossein Heidari

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出耦合物理门控适应方法,通过空间解码实现复杂3D打印物体中体积分子转换的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15734 2026-01-23 cs.CV 57%

Sub-Region-Aware Modality Fusion and Adaptive Prompting for Multi-Modal Brain Tumor Segmentation

子区域感知模态融合与自适应提示的多模态脑肿瘤分割

Shadi Alijani, Fereshteh Aghaee Meibodi, Homayoun Najjaran

机构 * University of Victoria, BC, Canada(维多利亚大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出子区域感知模态融合与自适应提示方法,提升多模态脑肿瘤分割的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09078 2026-01-15 cs.CV 57%

Exploring Reliable Spatiotemporal Dependencies for Efficient Visual Tracking

探索可靠的空间时间依赖性以实现高效的视觉跟踪

Junze Shi, Yang Yu, Jian Shi, Haibo Luo

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 STDTrack通过引入可靠的时空依赖性,提升轻量级视觉跟踪的效率和性能,在多个基准测试中取得最佳结果。

Comments 8 pages, 6 figures

Journal ref AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07620 2026-01-13 cs.CV 57%

PARL: Position-Aware Relation Learning Network for Document Layout Analysis

PARL:面向文档布局分析的位置感知关系学习网络

Fuyuan Liu, Dianyu Yu, He Ren, Nayu Liu, Xiaomian Kang, Delai Qiu, Fa Zhang, Genpeng Zhen, Shengping Liu, Jiaen Liang, Wei Huang, Yining Wang, Junnan Zhu

机构 * Unisound AI Technology Co.Ltd(Unisound人工智能技术有限公司) MAIS, Institute of Automation, CAS(MAIS,自动化研究所,中国科学院) Beihang University(北航) School of Computer Science and Technology, Tiangong University(天工大学计算机科学与技术学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 PARL提出一种无OCR的纯视觉框架,通过位置敏感性和关系结构建模文档布局,实现高效且鲁棒的布局分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00080 2026-01-13 eess.SY cs.SY eess.SP 57%

Arithmetic Average Density Fusion -- Part IV: Distributed Heterogeneous Fusion of RFS and LRFS Filters via Variational Approximation

算术平均密度融合——第四部分:通过变分近似实现RFS和LRFS滤波器的分布式异构融合

Tiancheng Li, Haozhe Liang, Guchong Li, Jesús García Herrero, Quan Pan

专题命中 融合架构与评测 :information fusion(abstract);分类 eess.SP

AI总结 本文提出基于变分近似的分布式异构融合方法,实现RFS与LRFS滤波器的协同跟踪,通过平均PHD达成共识,适用于同构和异构多传感器场景。

Comments 13 pages,14 figures

Journal ref IEEE Transactions on Signal Processing, vol. 73, pp. 1454-1469, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14329 2026-01-12 cs.MM 57%

TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis

具有缺失模态的文本增强融合Mamba用于鲁棒多模态情感分析

Xiang Li, Xianfu Cheng, Dezhuang Miao, Xiaoming Zhang, Zhoujun Li

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 TF-Mamba通过文本增强融合框架,有效处理多模态情感分析中缺失模态的问题,提升模型鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16942 2026-01-08 cs.SI cs.AI cs.CV 57%

S2Vec: Self-Supervised Geospatial Embeddings for the Built Environment

S2Vec: 自监督的建成环境地理嵌入

Shushman Choudhury, Elad Aharoni, Chandrakumari Suvarna, Iveel Tsogsuren, Abdul Rahman Kreidieh, Chun-Ta Lu, Neha Arora

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 S2Vec通过自监督学习生成通用的地理空间嵌入,适用于建成环境特征的表示,并在社会经济任务中表现优异,同时支持多模态融合提升性能。

Journal ref ACM Transactions on Spatial Algorithms and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02874 2026-01-07 eess.SP 57%

Transparent and Resilient Activity Recognition via Attention-Based Distributed Radar Sensing

通过基于注意力的分布式雷达感知实现透明且稳健的活动识别

Mina Shahbazifar, Zolfa Zeinalpour-Yazdi, Matthias Hollick, Arash Asadi, Vahid Jamali

专题命中 融合架构与评测 :information fusion(abstract);分类 eess.SP

AI总结 本文提出一种基于注意力的分布式雷达感知框架,通过轻量CNN提取局部特征并结合自注意力融合机制,实现高效透明的人体活动识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01033 2026-01-06 eess.SP 57%

System-Level Comparison of Multimodal and In-Band mmWave Sensing for Beam Prediction in 6G ISAC

6G ISAC中多模态与带内毫米波感知的系统级比较:用于基站预测

Abidemi Orimogunje, Hyunwoo Park, Igbafe Orikumhi, Sunwoo Kim, Dejan Vukobratovic

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 本文提出了一种系统级框架,通过多模态融合评估毫米波与体外传感器在6G ISAC中的波束预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01022 2026-01-06 cs.CV cs.AI cs.LG 57%

Decoupling Amplitude and Phase Attention in Frequency Domain for RGB-Event based Visual Object Tracking

频域中解耦幅度与相位注意力以实现RGB-事件视觉目标跟踪

Shiao Wang, Xiao Wang, Haonan Zhao, Jiarui Xu, Bo Jiang, Lin Zhu, Xin Zhao, Yonghong Tian, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Northeastern University(东北大学) Beijing Institute of Technology(北京理工大学) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Peng Cheng Laboratory(鹏城实验室) National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 cs.CV

AI总结 本文提出了一种在频域中解耦幅度与相位注意力的RGB-事件视觉目标跟踪方法,通过高频信息融合和运动引导稀疏化模块提升跟踪性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21916 2025-12-29 cs.CV 57%

Patch as Node: Human-Centric Graph Representation Learning for Multimodal Action Recognition

补丁作为节点:面向多模态动作识别的人本图表示学习

Zeyu Liang, Hailun Xia, Naichuan Zheng

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出PAN框架,通过人本图表示学习提升多模态动作识别性能,结合双路径和统一网络结构实现高效融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21476 2025-12-29 cs.CV cs.AI 57%

GPF-Net: Gated Progressive Fusion Learning for Polyp Re-Identification

GPF-Net:门控渐进融合学习用于息肉重识别

Suncheng Xiang, Xiaoyang Wang, Junjie Jiang, Hejia Wang, Dahong Qian

机构 * Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Fifth People's Hospital(上海第五人民医院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 GPF-Net通过门控渐进融合学习提升息肉重识别性能,结合多模态融合策略优于现有单模态模型。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20501 2025-12-24 cs.CV 57%

Bridging Modalities and Transferring Knowledge: Enhanced Multimodal Understanding and Recognition

弥合模态与知识转移:增强多模态理解和识别

Gorjan Radevski

机构 * University of Bristol(布里斯托大学) University of Würzburg(乌尔姆大学) Processing Speech and Images (PSI)(语音与图像处理组)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出多模态对齐、翻译、融合和转移方法,提升复杂输入的理解与识别能力,涵盖空间语言、医学文本、知识图谱和动作识别等多个领域。

Comments Ph.D. manuscript; Supervisors/Mentors: Marie-Francine Moens and Tinne Tuytelaars

详情

展开后加载摘要…

URL PDF HTML 收藏