VTFusion: A Vision-Text Multimodal Fusion Network for Few-Shot Anomaly Detection
VTFusion: 一种面向少样本异常检测的视觉-文本多模态融合网络
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 VTFusion通过自适应特征提取和多模态融合模块,提升少样本异常检测性能,实现96.8%的AUROC。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
VTFusion: 一种面向少样本异常检测的视觉-文本多模态融合网络
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 VTFusion通过自适应特征提取和多模态融合模块,提升少样本异常检测性能,实现96.8%的AUROC。
解耦多对比超分辨率:自监督隐式重表示用于无配对跨模态合成
专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出了解耦多对比超分辨率框架,通过自监督隐式重表示实现无配对跨模态合成,提升极端尺度下的超分辨率性能。
REL-SF4PASS:基于REL深度表示和球形融合的全景语义分割
机构 * School of Electronic and Information Engineering, Shanghai DianJi University(电子信息学院,上海电机大学) ; College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 REL-SF4PASS通过REL深度表示和球形动态多模态融合方法,提升全景语义分割的性能和鲁棒性。
Comments submitted to CVPR 2026
增强型多域特征选择与融合的无地图轨迹预测
机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) ; Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) ; Leapmotor Technology(Leapmotor科技) ; Department of Aeronautical and Automotive Engineering, Loughborough University(伦敦大学洛桑学院航空与汽车工程系)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种无地图轨迹预测方法,通过多域特征选择与融合,提升轨迹预测的准确性和效率。
AuroraEdge-V-2B: 一种更快更强大的边缘视觉大语言模型
机构 * Independent Researcher(独立研究者)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 AuroraEdge-V-2B是一种为边缘部署设计的高性能视觉大语言模型,具有紧凑参数、高速推理和强大性能的特点。
基于语言引导和运动感知的通用识别姿态表示
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 LMGait通过引入自然语言描述作为语义先验,结合运动感知模块和时间捕获模块,提升了姿态识别的通用性和准确性。
贝叶斯联合加性因子模型用于多视图学习
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 本文提出贝叶斯联合加性因子模型用于多视图学习,通过分解共享和视图特定成分提升多模态数据预测性能。
Comments To be published in Biometrics