arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2604.19202 2026-04-22 cs.GR cs.CV

SketchFaceGS: Real-Time Sketch-Driven Face Editing and Generation with Gaussian Splatting

SketchFaceGS: 基于草图的实时人脸编辑与生成与高斯点散布

Bo Li, Jiahao Kang, Yubo Ma, Feng-Lin Liu, Bin Liu, Fang-Lue Zhang, Lin Gao

机构 * Shandong Technology and Business University(山东科技与商务大学) Nanchang Hangkong University(南昌航空大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) University of New South Wales(新南威尔士大学)

AI总结 本文提出SketchFaceGS,通过高斯点散布实现基于2D草图的实时人脸生成与编辑,采用粗到细架构和UV特征预测模块,提升生成和编辑的精度与灵活性。

Comments Accepted to CVPR 2026 as a Highlight. Jittor implementation: https://github.com/gogoneural/SketchFaceGS_jittor. (C) 2026 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19141 2026-04-22 cs.CV

Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation

去噪、快速与缓慢:面向图像生成的难度感知自适应采样

Johannes Schusterbauer, Ming Gui, Yusong Li, Pingchuan Ma, Felix Krause, Björn Ommer

机构 * CompVis LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

AI总结 本文提出Patch Forcing框架,通过自适应采样和空间噪声变化提升图像生成效果,优于传统基线方法,适用于分类条件ImageNet和文本到图像生成。

Comments CVPR 2026, Code: https://github.com/CompVis/patch-forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18957 2026-04-22 cs.CV

Bridging Foundation Models and ASTM Metallurgical Standards for Automated Grain Size Estimation from Microscopy Images

弥合基础模型与ASTM冶金标准以实现显微图像中的晶粒尺寸自动估计

Abdul Mueez, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

AI总结 本文提出一种结合Cellpose-SAM和ASTM E112 Jeffries平面模块的自动化管道,用于显微图像中的密集实例分割和晶粒尺寸估计,通过拓扑感知梯度追踪和适应性提示生成,实现高精度的冶金评估。

Comments Accepted at the 11th IEEE Workshop on Computer Vision for Multimodal Microscopy Image Analysis (CVMI), CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18881 2026-04-22 cs.CV cs.AI

A Proxy Consistency Loss for Grounded Fusion of Earth Observation and Location Encoders

一种用于地球观测与位置编码器 grounded 融合的代理一致性损失

Zhongying Wang, Kevin Lane, Levi Cai, Morteza Karimzadeh, Esther Rolf

机构 * University of Colorado, Boulder(科罗拉多大学,博尔德)

AI总结 本文提出代理一致性损失,通过可训练的位置编码器融合地球观测数据与代理变量,提升小样本下的预测性能与鲁棒性。

Comments Accepted to EarthVision 2026 (CVPR Workshop). 13 pages total (10 pages main paper + 3 pages supplementary material), 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18867 2026-04-22 cs.CV cs.AI cs.LG

Hierarchically Robust Zero-shot Vision-language Models

层次化鲁棒零样本视觉-语言模型

Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz

机构 * Nanyang Technological University(南洋理工大学) CFAR, IHPC, A*STAR(CFAR、IHPC、A*STAR) Northwest Polytechnical University(西北工业大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

AI总结 本文提出基于层次嵌入的鲁棒微调框架,提升视觉-语言模型对对抗攻击的鲁棒性,通过多级对抗对齐和层次嵌入深度控制,增强模型泛化能力与语义多样性。

Comments This paper is accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18829 2026-04-22 cs.CV

DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

DUALVISION:用于鲁棒视觉推理的RGB-红外多模态大语言模型

Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon(亚马逊) Northeastern University(东北大学)

AI总结 本文提出DUALVISION,通过局部化交叉注意力融合IR-RGB信息,提升多模态大语言模型在视觉退化条件下的性能,并引入DV-204K和DV-500数据集进行评估。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18811 2026-04-22 cs.LG cs.CV

Rethinking Dataset Distillation: Hard Truths about Soft Labels

重新思考数据集蒸馏:关于软标签的硬事实

Priyam Dey, Aditya Sahdev, Sunny Bhati, Konda Reddy Mopuri, R. Venkatesh Babu

机构 * Vision and AI Lab, Indian Institute of Science, Bangalore(印度科学研究院视觉与人工智能实验室,班加罗尔) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) IIT Hyderabad(海得拉巴理工学院)

AI总结 本文重新审视数据集蒸馏,发现软标签在下游模型训练中性能与随机基线相当,提出CAD-Prune和CA2D方法提升数据效率。

Comments CVPR 2026 (Oral). First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17797 2026-04-22 cs.CV

Weakly-Supervised Referring Video Object Segmentation through Text Supervision

通过文本监督实现弱监督的指称视频对象分割

Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

AI总结 本文提出WSRVOS方法,通过文本表达训练模型,利用对比学习生成正负表达,实现细粒度多模态对齐,并引入实例感知分类和伪掩码融合策略,提升视频对象分割性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17736 2026-04-22 cs.CV

IncreFA: Breaking the Static Wall of Generative Model Attribution

IncreFA: 破解生成模型归因的静态壁垒

Haotian Qin, Dongliang Chang, Yueying Gao, Yuexuan Tan, Lei Chen, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Tsinghua University(清华大学)

AI总结 IncreFA将归因重新定义为结构化增量学习问题,通过层级约束和潜在记忆库机制,在28个生成模型上实现最先进的归因准确率和未见检测率。

Comments Accepted to CVPR 2026, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16177 2026-04-22 cs.CV

Winner of CVPR2026 NTIRE Challenge on Image Shadow Removal: Semantic and Geometric Guidance for Shadow Removal via Cascaded Refinement

CVPR2026图像阴影去除挑战赛冠军:基于级联细化的语义与几何引导的阴影去除

Lorenzo Beltrame, Jules Salzinger, Filip Svoboda, Jasmin Lampert, Phillipp Fanta-Jende, Radu Timofte, Marco Körner

机构 * Austrian Institute of Technology(奥地利理工学院) Technical University of Munich(慕尼黑技术大学) University of Cambridge(剑桥大学) University of Würzburg(乌尔姆大学)

AI总结 本文提出一种三阶段渐进式阴影去除管道,结合冻结的DINOv2语义引导和单目深度及表面法线几何线索,通过级联细化消除残留误差,最终在WSRD+2026测试集上取得最佳成绩。

Comments 10 pages, 4 figures, 5 tables, accepted at the CVPR 2026 Workshops (NTIRE 2026 Image Shadow Removal Challenge). Code and materials are available at https://github.com/AIT-Assistive-Autonomous-Systems/SGCR-SR . Corrected author name spelling in metadata and manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06665 2026-04-22 cs.CV

VDPP: Video Depth Post-Processing for Speed and Scalability

VDPP:用于速度和可扩展性的视频深度后处理

Daewon Yoon, Injun Baek, Sangyu Han, Yearim Kim, Nojun Kwak

机构 * Seoul National University(首尔国立大学) Samsung Electronics(三星电子)

AI总结 本文提出VDPP框架,通过改进视频深度估计的后处理速度和精度,采用几何细化方法提升效率,实现与端到端系统同等的时序一致性,同时具备RGB-free架构,支持实时边缘部署。

Comments 8 pages, 6 figures. Accepted to CVPR 2026 ECV Workshop. Project page: https://github.com/injun-baek/VDPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15577 2026-04-22 cs.CV

MoonSeg3R: Monocular Online Zero-Shot Segment Anything in 3D with Reconstructive Foundation Priors

MoonSeg3R: 单目在线零样本三维实例分割与重建基础先验

Zhipeng Du, Duolikun Danier, Jan Eric Lenssen, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC)

AI总结 本文提出MoonSeg3R,通过引入自监督查询精炼模块、3D查询索引记忆和CUT3R状态分布token,实现单目在线零样本三维实例分割,性能媲美RGB-D系统。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00993 2026-04-22 cs.CV

PhotoFramer: Multi-modal Image Composition Instruction

PhotoFramer:多模态图像构图指令

Zhiyuan You, Ke Wang, He Zhang, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong, Zhoutong Zhang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Adobe Research Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(InnoHK下的CPII) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 PhotoFramer通过多模态框架为用户提供图像构图指导,通过自然语言描述改进方法并生成示例图像,结合文本与图像生成模型提升日常用户构图能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18476 2026-04-21 cs.CV

SemLT3D: Semantic-Guided Expert Distillation for Camera-only Long-Tailed 3D Object Detection

SemLT3D: 基于语义的专家蒸馏用于仅相机的长尾3D目标检测

Hao Vo, Khoa Vo, Thinh Phan, Ngo Xuan Cuong, Gianfranco Doretto, Hien Nguyen, Anh Nguyen, Ngan Le

机构 * AICV Lab, University of Arkansas, USA(AICV实验室,阿肯色大学,美国) University of Utah, USA(犹他大学,美国) University of Houston, USA(休斯顿大学,美国) University of Liverpool, UK(利物浦大学,英国)

AI总结 针对仅相机3D目标检测中长尾不平衡问题,提出SemLT3D框架,通过语义先验增强稀有类别表示,结合语言引导的专家混合模块和语义投影蒸馏流程,提升模型对长尾分布和复杂场景的识别能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18348 2026-04-21 cs.CV cs.AI

AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation

AdaCluster:用于视频生成中稀疏注意力的自适应查询-键聚类

Haoyue Tan, Shengnan Wang, Yulin Qiao, Juncheng Zhang, Youhui Bai, Ping Gong, Zewen Jin, Cheng Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Independent Researcher(独立研究员) University of Macau(澳门大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对视频扩散变换器的高推理延迟问题,提出AdaCluster框架,通过自适应聚类方法提升生成速度并保持精度。

Comments CVPR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18267 2026-04-21 cs.CV

MARCO: Navigating the Unseen Space of Semantic Correspondence

MARCO:导航语义对应未知空间

Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth

机构 * Politecnico di Torino(都灵理工大学) TU Darmstadt(德累斯顿理工大学) ELIZA

AI总结 MARCO通过新颖的训练框架提升语义对应泛化能力,在多个数据集上取得新突破,同时更高效且更小。

Comments CVPR 2026 Oral. Project page: https://visinf.github.io/MARCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18260 2026-04-21 cs.CV

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18107 2026-04-21 cs.CV

Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models

基于延迟反馈的测试时扰动学习用于视觉-语言-动作模型

Zehua Zang, Xi Wang, Fuchun Sun, Xiao Xu, Lixiang Lium, Jiahuan Zhou, Jiangmeng Li

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) National Defense University(国防大学)

AI总结 本文提出PDF框架,通过不确定性数据增强和动作投票缓解轨迹过拟合,提升决策性能,实验显示在LIBERO和Atari任务中取得显著成效。

Comments 12 pages, 7 figures, 5 tables

Journal ref CVPR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18075 2026-04-21 cs.CV

Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting

通过动态前缀加权增强视觉-语言模型的持续学习

Hyeonseo Jang, Hyuk Kwon, Kibok Lee

机构 * Yonsei University(延世大学)

AI总结 本文提出动态前缀加权框架,通过动态调整前缀权重和适配器机制,提升视觉-语言模型在领域-类别增量学习中的性能。

Comments CVPR 2026; revised text and figures for improved readability

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17965 2026-04-21 cs.CV

MU-GeNeRF: Multi-view Uncertainty-guided Generalizable Neural Radiance Fields for Distractor-aware Scene

MU-GeNeRF:多视角不确定性引导的可泛化神经辐射场用于干扰感知场景

Wenjie Mu, Zhan Li, Chuanzhou Su, Xuanyi Shen, Ziniu Liu, Fan Lu, Yujian Mo, Junqiao Zhao, Tiantian Feng, Chen Ye, Guang Chen

机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) MOE Key Lab of Embedded System and Service Computing, Tongji University, Shanghai, China(同济大学嵌入式系统与服务计算MOE重点实验室,上海,中国) College of Surveying and Geographic Informatics, Tongji University, Shanghai, China(同济大学测绘地理信息学院,上海,中国)

AI总结 本文提出MU-GeNeRF,通过多视角不确定性组件提升神经辐射场在存在瞬时干扰时的鲁棒性,实验表明其在场景重建中优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17831 2026-04-21 cs.CV cs.GR

PCM-NeRF: Probabilistic Camera Modeling for Neural Radiance Fields under Pose Uncertainty

PCM-NeRF:在姿态不确定性下基于概率的相机建模用于神经辐射场

Shravan Venkatraman, Rakesh Raj Madavan, Pavan Kumar Sathya Venkatesh

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) University of Amsterdam(阿姆斯特丹大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 PCM-NeRF通过引入可学习的不确定性来增强神经表面重建,利用概率分布建模相机姿态,有效应对姿态估计不准确的问题,提升重建精度。

Comments CVPR-W 2026 (GenRec3D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04787 2026-04-21 cs.CV

AvatarPointillist: AutoRegressive 4D Gaussian Avatarization

AvatarPointillist: 基于自回归的4D高斯虚拟角色生成

Hongyu Liu, Xuan Wang, Zijian Wu, Yating Wang, Ziyu Wan, Yue Ma, Runtao Liu, Boyao Zhou, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

AI总结 本文提出AvatarPointillist框架,通过自回归Transformer生成动态4D高斯虚拟角色,结合点云生成与高斯点散射,实现高精度、可控制的虚拟角色生成。

Comments Accepted by the CVPR 2026 main conference. Project page: https://kumapowerliu.github.io/AvatarPointillist/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01643 2026-04-21 cs.CV

ViT$^3$: Unlocking Test-Time Training in Vision

ViT$^3$:解锁视觉中的测试时间训练

Dongchen Han, Yining Li, Tianyu Li, Zixuan Cao, Ziming Wang, Jun Song, Yu Cheng, Bo Zheng, Gao Huang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出ViT$^3$,一种线性复杂度的纯测试时间训练模型,通过系统研究揭示了视觉序列建模中TTT设计的六个实用原则,并在多个视觉任务中验证其性能。

Comments CVPR 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17699 2026-04-21 cs.CV cs.AI

Understanding Counting Mechanisms in Large Language and Vision-Language Models

理解大语言和视觉-语言模型中的计数机制

Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari, Mobin Bagherian, Sadegh Mohammadian, Mohammad Izadi, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫大学)

AI总结 本文研究大语言和视觉-语言模型在计数任务中如何表示和计算数值信息,通过实验和分析揭示了计数机制的分层结构及内部计数器的作用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14582 2026-04-21 cs.CV

OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models

OmniZip:面向快速多模态大语言模型的音频引导动态令牌压缩

Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出OmniZip,一种无需训练的音频引导多模态令牌压缩框架,通过动态压缩音频视频令牌提升推理速度和内存效率,保持模型性能。

Comments [CVPR 2026] Code Link: https://github.com/KD-TAO/OmniZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12554 2026-04-21 cs.CV

EmoVerse: A MLLMs-Driven Emotion Representation Dataset for Interpretable Visual Emotion Analysis

EmoVerse:一种基于大语言模型的emotion表示数据集用于可解释的视觉emotion分析

Yijie Guo, Dexiang Hong, Weidong Chen, Zihan She, Cheng Ye, Xiaojun Chang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出EmoVerse数据集,通过多层知识图谱注释实现可解释的视觉情绪分析,包含219k张图像和双注释,提供离散和连续情绪表示,结合新颖的多阶段流程和可解释模型推动高阶情绪理解。

Comments 11 pages, 7 figures. This is a preprint version of a paper submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11113 2026-04-21 cs.CV cs.AI cs.LG

VIDEOP2R: Video Understanding from Perception to Reasoning

VIDEOP2R:从感知到推理的视频理解

Yifan Jiang, Yueying Wang, Rui Zhao, Toufiq Parag, Zhimin Chen, Zhenyu Liao, Jayakrishnan Unnikrishnan

机构 * USC(USC大学) Amazon(亚马逊) Keystone AI

AI总结 VIDEOP2R提出一种过程感知的视频RFT框架,通过三步流程生成高质量CoT数据集,并引入PA-GRPO算法提升视频推理性能,实现在七个基准中的六个达到SotA水平。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10370 2026-04-21 cs.CV cs.AI cs.LG

SHRUG-FM: Reliability-Aware Foundation Models for Earth Observation

SHRUG-FM:面向地球观测的可靠性感知基础模型

Maria Gonzalez-Calabuig, Kai-Hendrik Cohrs, Vishal Nedungadi, Zuzanna Osika, Ruben Cartuyvels, Steffen Knoblauch, Joppe Massant, Shruti Nath, Patrick Ebel, Vasileios Sitokonstantinou

机构 * Universitat de València(瓦伦西亚大学) Wageningen University & Research(瓦赫宁根大学与研究所) Delft University of Technology(代尔夫特理工大学) European Space Agency(欧洲航天局) Heidelberg University(海德堡大学) Ghent University(根特大学) University of Oxford(牛津大学) Google Research(谷歌研究)

AI总结 本文提出SHRUG-FM框架,通过整合三种互补信号提升地球观测基础模型的可靠性,实验证明其在高风险任务中有效降低预测风险。

Comments Accepted for proceedings at CVPR EarthVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23724 2026-04-21 cs.CV cs.AI

Video Panels for Long Video Understanding

用于长视频理解的视频面板

Lars Doorenbos, Federico Spurio, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

AI总结 本文提出一种无需训练的视觉提示策略,通过将多帧组合成图像以换取时间分辨率,提升了长视频理解模型的性能,实验表明在多个基准上效果显著。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08013 2026-04-21 cs.CV cs.AI cs.LG

StableMTL: Repurposing Latent Diffusion Models for Multi-Task Learning from Partially Annotated Synthetic Datasets

StableMTL: 利用潜在扩散模型重新利用多任务学习于部分标注的合成数据集

Anh-Quan Cao, Ivan Lopes, Raoul de Charette

机构 * Inria(法国国家科研机构)

AI总结 本文提出StableMTL,通过利用扩散模型的泛化能力,在部分标注的合成数据集上进行多任务学习,采用统一的潜在损失和多流模型促进任务间协同,优于基线模型。

Comments Accepted at CVPR 2026. Code is at https://github.com/astra-vision/StableMTL

详情

展开后加载摘要…

URL PDF HTML 收藏