arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2211.14456 2026-04-14 cs.CV

TetraSphere: A Neural Descriptor for O(3)-Invariant Point Cloud Analysis

TetraSphere:一种用于O(3)不变点云分析的神经描述符

Pavlo Melnyk, Andreas Robinson, Michael Felsberg, Mårten Wadenbäck

机构 * Computer Vision Laboratory, Department of Electrical Engineering, Linköping University(林雪平大学电气工程系计算机视觉实验室)

AI总结 本文提出TetraSphere,一种基于可旋转3D球神经元和向量神经元的O(3)不变描述符,通过端到端训练提升点云旋转不变性,在ScanObjectNN和ModelNet40上取得新突破。

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10772 2026-04-14 cs.CV

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑

Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh

机构 * The Hong Kong Polytechnic University(香港理工大学) Beijing Institute of Technology(北京理工大学)

AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10643 2026-04-14 cs.CV

LogitDynamics: Reliable ViT Error Detection from Layerwise Logit Trajectories

LogitDynamics:从层间Logit轨迹可靠检测ViT错误

Ido Beigelman, Moti Freiman

机构 * Technion - Israel Institute of Technology(以色列理工学院)

AI总结 本文提出通过层间Logit轨迹分析可靠检测ViT模型错误,利用轻量线性头提取特征预测错误指示器,提升AUCPR并增强跨数据集泛化能力。

Comments Accepted to the HOW 2026 workshop at CVPR 2026; 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10591 2026-04-14 cs.CV cs.AI

GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing

GeoMeld:迈向遥感领域语义引导的基模模型

Maram Hasan, Md Aminur Hossain, Savitra Roy, Souparna Bhowmik, Ayush V. Patel, Mainak Singha, Subhasis Chaudhuri, Muhammad Haris Khan, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Space Applications Centre, ISRO(印度空间研究组织空间应用中心) University of Trento(特伦托大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出GeoMeld数据集,通过语义引导的监督方法,结合多模态对齐,提升遥感领域基模模型的性能和鲁棒性。

Comments Accepted at CVPR Workshop 2026; 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10582 2026-04-14 cs.CV

TAPNext++: What's Next for Tracking Any Point (TAP)?

TAPNext++: 追踪任意点(TAP)的下一步

Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) German Aerospace Center (DLR)(德国航空航天中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Chandar Research Lab(钱达尔研究实验室) Polytechnique Montréal(蒙特利尔综合理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Technical University Munich (TUM)(慕尼黑工业大学)

AI总结 TAPNext++通过训练长序列和引入重检指标提升追踪性能,在保持低内存计算开销的同时实现更长序列的追踪。

Comments 8 pages, will be publised at CVPR Findings 2026, Website https://tap-next-plus-plus.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10573 2026-04-14 cs.CV

Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images

从未标注的多视角图像中学习3D表示以提升空间智能

Bo Zhou, Qiuxia Lai, Zeren Sun, Xiangbo Shu, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Communication University of China(中国传媒大学)

AI总结 本文提出UniSplat框架,通过双掩码策略、高斯溅射策略和姿态条件重校准机制,解决未标注多视角图像中3D表示学习的几何诱导弱、外观细节不足和几何语义不一致问题,实现鲁棒且通用的3D表示。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10551 2026-04-14 cs.CV

NTIRE 2026 Challenge on Short-form UGC Video Restoration in the Wild with Generative Models: Datasets, Methods and Results

2026年NTIRE挑战赛:基于生成模型的野生短形式UGC视频修复挑战:数据集、方法与结果

Xin Li, Jiachao Gong, Xijun Wang, Shiyao Xiong, Bingchen Li, Suhang Yao, Chao Zhou, Zhibo Chen, Radu Timofte, Yuxiang Chen, Shibo Yin, Yilian Zhong, Yushun Fang, Xilei Zhu, Yahui Wang, Chen Lu, Meisong Zheng, Xiaoxu Chen, Jing Yang, Zhaokun Hu, Jiahui Liu, Ying Chen, Haoran Bai, Sibin Deng, Shengxi Li, Mai Xu, Junyang Chen, Hao Chen, Xinzhe Zhu, Fengkai Zhang, Long Sun, Yixing Yang, Xindong Zhang, Jiangxin Dong, Jinshan Pan, Jiyuan Zhang, Shuai Liu, Yibin Huang, Xiaotao Wang, Lei Lei, Zhirui Liu, Shinan Chen, Shang-Quan Sun, Wenqi Ren, Jingyi Xu, Zihong Chen, Zhuoya Zou, Xiuhao Qiu, Jingyu Ma, Huiyuan Fu, Kun Liu, Huadong Ma, Dehao Feng, Zhijie Ma, Boqi Zhang, Jiawei Shi, Hao Kang, Yixin Yang, Yeying Jin, Xu Cheng, Yuxuan Jiang, Chengxi Zeng, Tianhao Peng, Fan Zhang, David Bull, Yanan Xing, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Jiajia Liu, Yaokun Shi, Wei Zhou, Linfeng Li, Hang Song, Qi Xu, Kun Yuan, Yizhen Shao, Yulin Ren

AI总结 本文介绍了2026年NTIRE挑战赛,旨在建立强大的基准以修复复杂现实降质下的短形式UGC视频,特别关注基于生成模型的S-UGC视频修复。挑战赛包含合成和真实视频数据,涵盖数据集、方法和结果。

Comments Accepted by CVPR 2026 workshop; NTIRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10546 2026-04-14 cs.CV

Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression

可微向量量化用于生成图像压缩的率-失真优化

Shiyin Jiang, Wei Long, Minghao Han, Zhenghao Chen, Ce Zhu, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) The University of Newcastle, Australia(澳大利亚纽卡斯尔大学)

AI总结 本文提出RDVQ框架,通过可微松弛代码本分布实现端到端率-失真优化,结合自回归熵模型实现准确的熵建模和测试时率控制,在极低比特率下取得优异性能。

Comments Accepted for publication at CVPR 2026 as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10527 2026-04-14 cs.CV cs.AI

STORM: End-to-End Referring Multi-Object Tracking in Videos

STORM:视频中的端到端提及多目标跟踪

Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

机构 * Amazon(亚马逊)

AI总结 STORM通过统一框架联合执行目标定位与跟踪,提升数据效率并构建新数据集,实现多目标跟踪的先进性能。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10485 2026-04-14 cs.CV cs.AI

UDAPose: Unsupervised Domain Adaptation for Low-Light Human Pose Estimation

UDAPose:无监督领域适应用于低光人类姿态估计

Haopeng Chen, Yihao Ai, Kabeen Kim, Robby T. Tan, Yixin Chen, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Duksung Women’s University(德成女子大学) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

AI总结 UDAPose提出了一种新的框架,通过合成低光图像并动态融合视觉线索与姿态先验,提升低光环境下的人体姿态估计性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10451 2026-04-14 cs.CV

Parameter Efficient Fine-tuning for Domain-specific Gastrointestinal Disease Recognition

领域特定胃肠道疾病识别的参数高效微调

Sanjaya Poudel, Nikita Kunwor, Raj Simkhada, Mustafa Munir, Manish Dhakal, Khem Poudel

机构 * Auburn University(奥本大学) Tribhuvan University(特里布万大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Georgia State University(佐治亚州立大学) Middle Tennessee State University(中田纳西州立大学)

AI总结 本文提出使用低秩适应(LoRA)模块进行参数高效微调,以解决跨源医学图像分布偏移问题,提升胃肠道疾病识别的参数效率和性能。

Comments 6 pages, 3 figures, CVPR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10419 2026-04-14 cs.ET

Roadside LiDAR for Cooperative Safety Auditing at Urban Intersections: Toward Auditable V2X Infrastructure Intelligence

道路激光雷达用于城市交叉口协作安全审计:迈向可审计的V2X基础设施智能

Bo Shang, Yiqiao Li

AI总结 本文提出一种可审计的道路激光雷达框架,用于评估纽约城市信号交叉口的基础设施安全,通过轨迹构建、迭代人工在环质量保证和可解释的近失分析,减少故障模式,展示道路激光雷达作为协作感知系统后验审计机制的可行性。

Comments 9 pages, 7 figures, 2026 CVPR DriveX Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10377 2026-04-14 cs.CV

DeepShapeMatchingKit: Accelerated Functional Map Solver and Shape Matching Pipelines Revisited

DeepShapeMatchingKit:加速的功能映射求解器和形状匹配流程再审视

Yizheng Xie, Lennart Bastian, Congyue Deng, Thomas W. Mitchel, Maolin Gao, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) MIT(麻省理工学院) Adobe Imperial College London(帝国理工学院) Simon Fraser University(西蒙菲莎大学)

AI总结 本文提出了一种向量化方法,通过单次核调用解决所有线性系统,提升计算效率,并分析了DiffusionNet的空间梯度特征差异,提供了改进的开源代码库。

Comments 10 pages, 8 figures, CVPR 2026 Image Matching Workshop (IEEE proceedings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05510 2026-04-14 cs.CV

Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality

在增强现实中评估视觉-语言模型在矛盾虚拟内容攻击下的基准测试

Yanming Xiu, Zhengyuan Jiang, Neil Zhenqiang Gong, Maria Gorlatova

机构 * Duke University(杜克大学)

AI总结 本文提出ContrAR基准,评估视觉-语言模型在增强现实中的鲁棒性,通过312个真实AR视频验证,测试11种VLMs,发现现有模型在检测对抗性内容操纵方面仍有改进空间。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03402 2026-04-14 eess.IV cs.CV

DRIFT: Deep Restoration, ISP Fusion, and Tone-mapping

DRIFT:深度恢复、ISP融合与色调映射

Soumendu Majee, Joshua Peter Ebenezer, Abhinau K. Venkataramanan, Weidi Liu, Thilo Balke, Zeeshan Nadir, Sreenithy Chandran, Seok-Jun Lee, Hamid Rahim Sheikh

机构 * Samsung Research America(三星美国研究院)

AI总结 本文提出DRIFT方法,通过多帧处理网络和深度学习色调映射实现高效移动相机流水线,生成高质量RGB图像,验证了其在性能和效率上的优势。

Comments Proceedings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02736 2026-04-14 cs.CV

THOM: Generating Physically Plausible Hand-Object Meshes From Text

THOM:从文本生成物理合理的手-物体网格

Uyoung Jeong, Yihalem Yimolal Tiruneh, Hyung Jin Chang, Seungryul Baek, Kwang In Kim

机构 * UNIST(蔚山科学技术院) University of Birmingham(伯明翰大学) POSTECH(浦项科技大学)

AI总结 THOM通过两阶段流程从文本生成物理合理的手-物体网格,无需模板网格,结合物理优化和视觉语言模型提升交互合理性。

Comments accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10128 2026-04-14 cs.CV

HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation

HG-Lane:在恶劣天气和光照条件下无需重新标注的高保真车道场景生成

Daichao Zhao, Qiupu Chen, Feng He, Xin Ning, Qiankun Li

机构 * Shanghai Jiao Tong University(上海交通大学) School of Artificial Intelligence, Henan University(河南大学人工智能学院) University of Science and Technology of China(中国科学技术大学) AnnLab, Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所 AnnLab) Nanyang Technological University(南洋理工大学)

AI总结 本文提出HG-Lane框架,通过构建包含30000张图像的基准数据集,提升恶劣天气下车道检测性能,实验显示基于CLRNet的mF1得分提升20.87%。

Comments Accepted by CVPR 2026 (HighLight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03197 2026-04-14 cs.CV

Specificity-aware reinforcement learning for fine-grained open-world classification

具有特异性的强化学习用于细粒度开放世界分类

Samuele Angheben, Davide Berasi, Alessandro Conti, Elisa Ricci, Yiming Wang

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

AI总结 本文提出SpeciaRL框架,通过强化学习提升细粒度开放世界分类的准确性和特异性,优于现有方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09211 2026-04-14 cs.CV

Affostruction: 3D Affordance Grounding with Generative Reconstruction

构形:基于生成重建的3D构形定位

Chunghyun Park, Seunghyeon Lee, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学) RLWRLD

AI总结 本文提出Affostruction框架,通过生成式重建完整物体几何并基于全形体进行构形定位,优于现有方法,在构形定位和3D重建上取得显著成绩。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20136 2026-04-14 cs.CL cs.AI

M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

M$^3$KG-RAG:多跳多模态知识图谱增强的检索增强生成

Hyeongcheol Park, Jiyoung Seo, Jaewon Mun, Hogun Park, Wonmin Byeon, Sung June Kim, Hyeonsoo Im, JeungSub Lee, Sangpil Kim

机构 * Korea University(高丽大学) Sungkyunkwan University(成均馆大学) NVIDIA Research(英伟达研究院) Hanwha Systems(韩华系统)

AI总结 本文提出M$^3$KG-RAG,通过构建多跳多模态知识图谱并引入GRASP机制,提升多模态大语言模型的推理深度和回答准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17012 2026-04-14 cs.CV

4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

4D-RGPT:通过感知蒸馏实现区域级4D理解

Chiao-An Yang, Ryo Hachiuma, Sifei Liu, Subhashree Radhakrishnan, Raymond A. Yeh, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA(英伟达)

AI总结 本文提出4D-RGPT和P4D框架,解决3D/4D视频问答中4D感知和时间理解不足的问题,并构建了区域级提示的R4D-Bench基准。

Comments CVPR 2026 (Highlight). Project page: https://www.ca-joe-yang.com/resource/projects/4D_RGPT/. GitHub: https://github.com/NVlabs/4D-RGPT. Dataset: https://huggingface.co/datasets/nvidia/R4D-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12968 2026-04-14 cs.CV

GrOCE:Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models

GrOCE:基于图的在线概念擦除用于文本到图像扩散模型

Ning Han, Zhenyu Ge, Feng Han, Yuhua Sun, Chengqing Li, Jingjing Chen

机构 * School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

AI总结 GrOCE提出一种无需训练的框架,通过动态语义图和适应性聚类识别实现精准的在线概念擦除,提升文本到图像扩散模型的语义准确性和稳定性。

Comments Accepted to CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03447 2026-04-14 cs.CV

CoPS: Conditional Prompt Synthesis for Zero-Shot Anomaly Detection

CoPS:用于零样本异常检测的条件提示合成

Qiyu Chen, Zhen Qu, Wei Luo, Haiming Yao, Yunkang Cao, Yuxin Jiang, Yinan Duan, Huiyuan Luo, Chengkan Lv, Zhengtao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CASIVISION(中科视语) THU(清华大学) HNU(湖南大学) HUST(华中科技大学)

AI总结 本文提出CoPS框架,通过动态提示合成提升零样本异常检测性能,利用视觉特征生成适应性状态模型,并在13个工业和医疗数据集上取得分类AUROC和分割AUROC的提升。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01201 2026-04-14 cs.CV

Perceptual Inductive Bias Is What You Need Before Contrastive Learning

感知归纳偏置是在对比学习之前所需的东西

Tianqin Li, Junru Zhao, Dunhan Jiang, Shenghao Wu, Alan Ramirez, Tai Sing Lee

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出在对比学习前引入感知归纳偏置,通过构建边界和表面表示来提升ResNet18的收敛速度和最终表示质量。

Comments CVPR 2025. Tianqin Li and Junru Zhao contributed equally to this work. Due to a formatting error during the CVPR submission, the equal contribution note was omitted in the official proceedings. This arXiv version corrects that oversight. The author order follows alphabetical order by last name. Code: https://github.com/juz031/MidVCL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10692 2026-04-14 cs.CV cs.RO

Exploring the best way for UAV visual localization under Low-altitude Multi-view Observation Condition: a Benchmark

探索在低空多视角观测条件下无人机视觉定位的最佳方法:一个基准

Yibin Ye, Xichao Teng, Shuo Chen, Leqi Liu, Kun Wang, Xiaokai Song, Zhang Li

机构 * National University of Defense Technology(国防科技大学)

AI总结 本文提出一个基准,用于评估低空多视角条件下无人机视觉定位方法,通过构建大规模数据集和统一框架,分析影响定位精度的关键因素,并提出新的检索指标PDM@K。

Comments Accepted by CVPRF 2026 (Findings of the Conference on Computer Vision and Pattern Recognition 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17163 2026-04-14 cs.CV

OSDFace: One-Step Diffusion Model for Face Restoration

OSDFace:面向面部修复的一步扩散模型

Jingkai Wang, Jue Gong, Lin Zhang, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 OSDFace提出一种一步扩散模型,通过视觉嵌入器和面部身份损失提升面部修复的视觉质量和身份一致性。

Comments Accepted to CVPR 2025. The code and model will be available at https://github.com/jkwang28/OSDFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10127 2026-04-14 cs.CV cs.AI

VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation

VGA-Bench:一个统一的基准和多模型框架用于视频审美和生成质量评估

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin

机构 * Ant Group(蚂蚁集团) Beijing Film Academy(北京电影学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)

AI总结 本文提出VGA-Bench,通过三层次分类体系,结合1016个多样化提示生成60000+视频数据集,设计多任务神经评估器,实现视频生成质量与审美质量的系统评估。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10064 2026-04-14 cs.CV

On The Application of Linear Attention in Multimodal Transformers

多模态Transformer中线性注意力的应用

Armin Gerami, Seyedehanita Madani, Ramani Duraiswami

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文研究了线性注意力在多模态框架中的应用,通过减少计算开销并保持性能,证明了线性注意力在多模态Transformer中的有效性。

Comments Workshop on Any-to-Any Multimodal Learning (Any2Any), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10056 2026-04-14 cs.CV

U$^{2}$Flow: Uncertainty-Aware Unsupervised Optical Flow Estimation

U²Flow:基于不确定性的无监督光流估计

Xunpei Sun, Wenwei Lin, Yi Chang, Gang Chen

机构 * Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 U²Flow是首个联合估计光流和像素不确定性的无监督框架,通过解耦学习策略从增强一致性中获取不确定性监督,提升训练稳定性。引入不确定性引导的双向流融合机制,实验表明其在KITTI和Sintel上达到无监督方法最优,生成可靠不确定性图。

Comments Accepted as an oral presentation at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10040 2026-04-14 cs.CV

Intra-finger Variability of Diffusion-based Latent Fingerprint Generation

基于扩散模型的指纹生成内部手指变异性研究

Noor Hussein, Anil K. Jain, Karthik Nandakumar

机构 * Michigan State University(密歇根州立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文系统评估了使用先进扩散模型生成的合成指纹(特别是潜在指纹)的内部手指变异性,通过构建包含七种多样数据集的潜在风格库,提高了生成模型的潜在风格多样性,并分析了生成指纹中ridge和 minutiae的完整性。

Comments Accepted at the 2nd Workshop on Foundation and Generative Models in Biometrics (FoundGen-Bio), held in conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏