arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 1417 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1417 篇

2604.27259 2026-05-01 cs.CV cs.LG 57%

VTBench: A Multimodal Framework for Time-Series Classification with Chart-Based Representations

VTBench: 一种基于图表表示的多模态时间序列分类框架

Madhumitha Venkatesan, Xuyang Chen, Dongyu Liu

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出VTBench,通过融合原始序列和图表可视化,系统评估了时间序列分类中图表类型、视觉编码和数据集的影响,展示了图表模型在特定领域的竞争力及多模态融合的优势。

Comments 8 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23532 2026-04-28 cs.CV cs.AI 57%

Emotion-Conditioned Short-Horizon Human Pose Forecasting with a Lightweight Predictive World Model

基于轻量预测世界模型的情感条件短周期人体姿态预测

Jingni Huang, Peter Bloodsworth

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文研究了情感嵌入对短周期姿态预测的辅助作用,提出轻量级自回归预测世界模型,结合姿态关键点与情感嵌入,提升情感驱动动作序列的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03248 2026-04-27 cs.LG cs.AI cs.CV physics.med-ph 57%

Multimodal Neural Operators for Real-Time Biomechanical Modelling of Traumatic Brain Injury

多模态神经算子用于创伤性脑损伤的实时生物力学建模

Anusha Agarwal, Dibakar Roy Sarkar, Somdatta Goswami

机构 * Johns Hopkins Whiting School of Engineering(约翰霍普金斯大学惠廷工程学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出多模态神经算子架构用于创伤性脑损伤的生物力学建模,通过融合体积解剖影像、人口特征和采集参数,预测全字段脑位移,验证了DeepONet在准确性、速度和参数量上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03476 2026-04-24 cs.CV 57%

Anatomy-Aware Text-Visual Fusion with Dual-Perspective Prompts for Fine-Grained Lumbar Spine Segmentation

具有双视角提示的解剖感知文本-视觉融合用于细粒度腰椎分割

Sheng Lian, Jianlong Cai, Dengfeng Pan, Guang-Yong Chen, Hao Xu, Fan Zhang, Guodong Fan, Shuo Li

机构 * College of Computer and Data Science(计算机与数据科学学院) Shandong Technology and Business University(山东科技商务大学) Engineering Research Center of Big Data Intelligence (Fuzhou University)(大数据智能工程研究中心(福州大学)) The Chinese University of Hong Kong(香港中文大学) Case Western Reserve University(凯斯西储大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出ATM-Net框架,通过解剖感知文本引导的多模态融合机制,提升腰椎细粒度分割精度,实验表明其在MRSpineSeg和SPIDER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14574 2026-04-17 cs.CV 57%

M3D-Net: Multi-Modal 3D Facial Feature Reconstruction Network for Deepfake Detection

M3D-Net:面向深度伪造检测的多模态3D面部特征重建网络

Haotian Wu, Yue Cheng, Shan Bian

机构 * College of Mathematics and Informatics(数学与信息学院) South China Agricultural University(华南农业大学) Wushan Road, Tianhe District(天河南路) Guangzhou(广州) China(中国)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出M3D-Net,通过多模态特征融合和3D重建模块提升深度伪造检测的准确性和鲁棒性,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14520 2026-04-17 cs.CV 57%

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

模态链:从静态融合到动态编排在多模态大语言模型中

Ziyang Luo, Nian Liu, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出CoM框架,通过动态编排解决多模态融合的静态融合问题,提升模型在不同任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14025 2026-04-16 cs.CV cs.AI cs.GR 57%

Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

前馈3D场景建模:以问题为导向的视角

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学) ETH Zurich(苏黎世联邦理工学院) University of Tübingen(图宾根大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。

Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10000 2026-04-14 cs.CV 57%

SwinTextUNet: Integrating CLIP-Based Text Guidance into Swin Transformer U-Nets for Medical Image Segmentation

SwinTextUNet:将基于CLIP的文本引导整合到Swin Transformer U-Nets中用于医学图像分割

Ashfak Yeafi, Parthaw Goswami, Md Khairul Islam, Ashifa Islam Shamme

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出SwinTextUNet,结合CLIP文本嵌入与Swin Transformer U-Net,提升医学图像分割的鲁棒性和准确性,在QaTaCOV19数据集上取得86.47%的Dice和78.2%的IoU成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09932 2026-04-14 cs.LG cs.AI eess.SP 57%

A Hybrid Intelligent Framework for Uncertainty-Aware Condition Monitoring of Industrial Systems

一种用于工业系统不确定性感知条件监测的混合智能框架

Maryam Ahang, Todd Charter, Masoud Jalayer, Homayoun Najjaran

机构 * University of Victoria(维多利亚大学) Aalto University(阿尔托大学)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 eess.SP

AI总结 本文提出一种结合数据驱动学习与物理模型的混合框架,通过残差和时间特征提升诊断准确率,实验显示混合方法在非线性工业系统中提高了准确性和决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15198 2026-04-14 eess.SP 57%

Space-Time-Frequency Synthetic Integrated Sensing and Communication Networks

时空频合成集成感知与通信网络

Henglin Pu, Xuefeng Wang, Lu Su, Husheng Li

专题命中 融合架构与评测 :information fusion(abstract);分类 eess.SP

AI总结 本文提出一种时空频合成ISAC架构,融合分布式发射机和接收机的观测,推导CRLB并比较MLE与TSIF方法的性能,证明全合成网络处理对低SNR下估计精度至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08609 2026-04-13 cs.CV cs.AI cs.LG 57%

Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach

数字取证中的仇恨与威胁检测:基于案例的多模态方法

Ponkoj Chandra Shill

机构 * University of Nevada, Reno(内华达大学雷诺分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种基于案例的多模态方法,用于数字取证中的仇恨与威胁检测,通过区分文本证据、关联上下文文本和图像证据,提升取证的可追溯性和准确性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05873 2026-04-08 cs.MM 57%

Learning Shared Sentiment Prototypes for Adaptive Multimodal Sentiment Analysis

学习共享情感原型以实现自适应多模态情感分析

Chen Su, Yuanhe Tian, Yan Song

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 本文提出PRISM框架,通过共享原型空间实现多模态证据的结构化比较与自适应融合,动态调整模态权重以提升多模态情感分析性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06338 2026-04-07 cs.AI cs.CV cs.LG 57%

Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

扩散变换器中空间关系生成的电路机制

Binxu Wang, Jingxuan Fan, Xu Pan

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Harvard University(哈佛大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 研究通过机械可解释性方法探讨扩散变换器如何生成正确空间关系,发现不同文本编码器影响电路机制,随机嵌入通过双阶段电路生成,预训练编码器则通过信息融合生成,两种方法在领域内表现相似但抗扰性不同。

Comments 45 pages, 30 figures, accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02759 2026-04-06 cs.RO 57%

OMNI-PoseX: A Fast Vision Model for 6D Object Pose Estimation in Embodied Tasks

OMNI-PoseX:一种用于具身任务中6D物体姿态估计的高效视觉模型

Michael Zhang, Wei Ying, Fangwen Chen, Shifeng Bai, Hanwen Kang

机构 * KernalMind Tech Co., Ltd.(KernalMind科技有限公司)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.RO

AI总结 本文提出OMNI-PoseX,一种结合开放词汇感知与SO(3)感知的高效视觉模型,通过轻量级多模态融合策略实现稳定且高效的6D姿态估计,并在多个基准测试中展示了SOTA的精度和实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02397 2026-04-06 cs.CV cs.AI 57%

Variational Encoder--Multi-Decoder (VE-MD) for Privacy-by-functional-design (Group) Emotion Recognition

变分编码器-多解码器(VE-MD)用于隐私-by-功能设计(群体)情绪识别

Anderson Augusma, Dominique Vaufreydaz, Fédérique Letué

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学, 法国国家科学研究中心, 格勒诺布尔国立理工学院, 信息学实验室) Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学, 法国国家科学研究中心, 格勒诺布尔国立理工学院, 让·库尔坦研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出VE-MD框架,通过约束模型仅预测群体层面情绪,避免个体监控,提升群体情绪识别性能,实验显示其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01667 2026-04-03 cs.AI cs.CV 57%

M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis

M3D-BFS:一种多阶段动态融合策略用于样本自适应的多模态脑网络分析

Rui Dong, Xiaotong Zhang, Jiaxing Li, Yueying Li, Jiayin Wei, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出M3D-BFS,通过多阶段动态融合策略提升多模态脑网络分析的样本适应性,设计了不同专家模块以适应输入样本变化,并引入多模态解耦损失提升表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29291 2026-04-01 cs.CV cs.AI 57%

MELT: Improve Composed Image Retrieval via the Modification Frequentation-Rarity Balance Network

MELT:通过修改频繁性-稀有性平衡网络改进组合图像检索

Guozhi Qiu, Zhiwei Chen, Zixu Li, Qinlei Huang, Zhiheng Fu, Xuemeng Song, Yupeng Hu

机构 * School of Software, Shandong University(山东大学软件学院) Southern University of Science and Technology(南方科技大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MELT通过解决罕见语义定位不对称和硬负样本下的鲁棒相似性估计问题,改进组合图像检索的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27781 2026-03-31 cs.CV 57%

GS3LAM: Gaussian Semantic Splatting SLAM

GS3LAM: 基于高斯语义散射的SLAM

Linfei Li, Lin Zhang, Zhong Wang, Ying Shen

机构 * School of Software Engineering, Tongji University(同济大学软件工程学院) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 GS3LAM通过多模态数据融合实现实时一致的语义密集地图,采用语义高斯场和多模态误差约束联合优化,引入深度自适应尺度正则化和随机采样关键帧映射策略,提升跟踪鲁棒性和渲染质量。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27181 2026-03-31 cs.RO cs.AI 57%

An End-to-end Flight Control Network for High-speed UAV Obstacle Avoidance based on Event-Depth Fusion

面向高速无人机障碍避让的端到端飞行控制系统:基于事件深度融合

Dikai Shang, Jingyue Zhao, Shi Xu, Nanyang Ye, Lei Wang

机构 * Shanghai jiaotong University(上海交通大学) Defense Innovation Institute, AMS(军事科学院国防科技创新研究院)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 cs.RO

AI总结 本文提出端到端飞行控制网络,通过双向交叉注意力模块融合深度图像和事件数据,利用模仿学习训练,结合球面主搜索算法设计高效专家规划器,在高速环境下实现更可靠的障碍避让。

Comments 7 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12378 2026-03-31 cs.CV 57%

M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction

M4Human: 一种大规模多模态毫米波雷达基准用于人体网格重建

Junqiao Fan, Yunjiao Zhou, Yizhuo Yang, Xinyuan Cui, Jiarui Zhang, Lihua Xie, Jianfei Yang, Chris Xiaoxuan Lu, Fangqiang Ding

机构 * NTU(南洋理工大学) University of Edinburgh(爱丁堡大学) UPenn(宾夕法尼亚大学) UCL(伦敦大学学院) MIT(麻省理工学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出M4Human,首个大规模多模态毫米波雷达基准,提供高分辨率雷达、RGB和深度数据,用于解决传统视觉传感的遮挡、光照和隐私问题,推动人体建模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26746 2026-03-31 cs.CV cs.LG 57%

TDEC: Deep Embedded Image Clustering with Transformer and Distribution Information

TDEC:基于Transformer和分布信息的深度嵌入图像聚类

Ruilin Zhang, Haiyang Zheng, Hongpeng Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文提出TDEC,通过结合Transformer和分布信息,改进图像聚类中的特征表示和维度偏好,提升聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25799 2026-03-30 eess.SP 57%

Occlusion-Aware Multimodal Beam Prediction and Pose Estimation for mmWave V2I

面向毫米波V2I的遮挡感知多模态波束预测与姿态估计

Abidemi Orimogunje, Hyunwoo Park, Kyeong-Ju Cha, Igbafe Orikumhi, Sunwoo Kim, Dejan Vukobratovic

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 本文提出一种受SLAM启发的多模态学习框架,用于动态遮挡下的毫米波V2I波束管理,通过融合RGB图像、LiDAR点云、雷达范围-角度图、GNSS和短时毫米波功率历史,实现波束索引、遮挡概率和2D位置的联合预测,验证了感知与通信结合在6G V2I系统中的价值。

Comments IEEE VTC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21660 2026-03-24 cs.CV 57%

OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imaging

OmniFM:迈向模态鲁棒且任务无关的联邦学习 for 异质医学影像

Meilin Liu, Jiaying Wang, Jing Shan

机构 * School of Software, Shenyang University of Technology(沈阳理工大学软件学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 OmniFM提出一种统一训练分类、分割、超分辨率、视觉问答和多模态融合的联邦学习框架,通过频域洞察提升跨模态一致性,实现任务无关和模态鲁棒的联邦学习。

Comments Accepted by CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13876 2026-03-24 cs.CV 57%

Scene Prior Filtering for Depth Super-Resolution

场景先验过滤用于深度超分辨率

Zhengxue Wang, Zhiqiang Yan, Ming-Hsuan Yang, Jinshan Pan, Guangwei Gao, Ying Tai, Jian Yang

机构 * PCA Lab, Nanjing University of Science and Technology, China(南京理工大学科学与工程学院实验室) National University of Singapore(新加坡国立大学) University of California, USA, and Yonsei University, South Korea(美国加州大学和韩国延世大学) PCA Lab, Nanjing University, China(南京大学实验室)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出SPFNet网络,利用大尺度模型的表面法线和语义图作为先验信息,通过多模态先验传播和一对一先验嵌入减少纹理干扰并提升边缘表示,实现在真实和合成数据集上的超分辨率性能。

Comments Accepted to IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18062 2026-03-23 cs.CV cs.AI 57%

S3T-Former: A Purely Spike-Driven State-Space Topology Transformer for Skeleton Action Recognition

S3T-Former:一种纯粹由脉冲驱动的状态空间拓扑变换器用于骨骼动作识别

Naichuan Zheng, Hailun Xia, Zepeng Sun, Weiyi Li, Yujia Wang

机构 * School of Information and Communication Engineering(信息与通信工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) International School(国际学校) School of Economics and Management(经济管理学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出S3T-Former,一种专为高效骨骼动作识别设计的脉冲驱动变换器,通过多流解剖脉冲嵌入和横向脉冲拓扑路由实现稀疏事件流,提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16671 2026-03-18 cs.CV 57%

$x^2$-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space

$x^2$-Fusion:事件边缘空间中的跨模态和跨维度流估计

Ruishan Guo, Ciyu Ruan, Haoyang Wang, Zihang Gong, Jingao Xu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出$x^2$-Fusion方法,通过事件边缘空间实现跨模态和跨维度流的统一表示,提升动态场景理解的准确性和鲁棒性。

Comments This version is the camera-ready version accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13000 2026-03-18 cs.CV 57%

Omni Survey for Multimodality Analysis in Visual Object Tracking

多模态分析在视觉目标跟踪中的全方位调研

Zhangyong Tang, Tianyang Xu, Xuefeng Zhu, Hui Li, Shaochuan Zhao, Tao Zhou, Chunyang Cheng, Xiaojun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) School of Computer Science and Technology, China University of Mining and Technology(中国矿业大学计算机科学与技术学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey 大学视觉、语音与信号处理中心)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文从多模态分析角度调研了多模态视觉目标跟踪(MMVOT)的关键问题,涵盖数据收集、模态对齐、标注、模型设计与评估,分析了现有方法的分类及挑战,并首次探讨了多模态跟踪的适用性及数据集中的类别分布。

Comments The first comprehensive survey for multi-modal visual object tracking; 6 multi-modal tasks; 338 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12848 2026-03-16 cs.CV cs.AI 57%

Team LEYA in 10th ABAW Competition: Multimodal Ambivalence/Hesitancy Recognition Approach

团队LEYA在第10届ABAW竞赛中的多模态矛盾/犹豫识别方法

Elena Ryumina, Alexandr Axyonov, Dmitry Sysoev, Timur Abdulkadirov, Kirill Almetov, Yulia Morozova, Dmitry Ryumin

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡联邦科研中心) HSE University(俄罗斯高等经济学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出了一种多模态方法用于视频级矛盾/犹豫识别,结合场景、面部、音频和文本四种模态,通过融合模型提升识别性能,实验显示多模态融合优于单一模态方法。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09689 2026-03-12 cs.CV cs.AI 57%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13172 2026-03-10 cs.CV 57%

WHU-STree: A Multi-modal Benchmark Dataset for Street Tree Inventory

WHU-STree: 一个用于街道树盘点的多模态基准数据集

Ruifei Ding, Zhe Chen, Wen Fan, Chen Long, Huijuan Xiao, Yelu Zeng, Zhen Dong, Bisheng Yang

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 WHU-STree是一个多模态的街道树盘点数据集,包含丰富的标注和多任务支持,用于提升城市街道树管理的自动化和智能化水平。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, 2026, 233: 519-542

详情

展开后加载摘要…

URL PDF HTML 收藏