arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-17 至 2026-04-17 共收录 19
2604.15312 2026-04-17 cs.CV

Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo

双向跨模态提示用于事件-帧不对称立体

Ninghui Xu, Fabio Tosi, Lihui Wang, Jiawei Han, Luca Bartolomei, Zhiting Yao, Matteo Poggi, Stefano Mattoccia

机构 * School of Instrument Science and Engineering, Southeast University, State Key Lab of Comprehensive PNT Network and Equipment Technology, Key Lab of Micro-Inertial Instrument and Advanced Navigation Technology, MOE(仪器科学与工程学院,东南大学,综合PNT网络与设备技术国家重点实验室,微惯性仪器与先进导航技术重点实验室,教育部) Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学) College of Computer Science and Software Engineering, Hohai University(计算机科学与软件工程学院,河海大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出Bi-CMPStereo框架,通过双向跨模态提示利用语义和结构特征实现稳健匹配,提升高速运动和复杂光照下的3D感知性能。

Comments CVPR 2026. Code URL: https://github.com/xnh97/Bi-CMPStereo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15311 2026-04-17 cs.CV

LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

LeapAlign: 通过构建两步轨迹实现任意生成步骤的训练后流匹配模型对齐

Zhanhao Liang, Tao Yang, Jie Wu, Chengjian Feng, Liang Zheng

机构 * The Australian National University(澳大利亚国立大学)

AI总结 本文提出LeapAlign方法,通过缩短生成轨迹为两步,减少计算成本并实现早期生成步骤的梯度传播,提升模型更新效率与稳定性,优于现有方法。

Comments Accepted by CVPR 2026. Project page: https://rockeycoss.github.io/leapalign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15027 2026-04-17 cs.CV

Quality-Aware Calibration for AI-Generated Image Detection in the Wild

面向AI生成图像检测的高质量意识校准

Fabrizio Guillaro, Vincenzo De Rosa, Davide Cozzolino, Luisa Verdoliva

机构 * University Federico II of Naples(那不勒斯费德里科二世大学)

AI总结 本文提出QuAD框架,通过整合图像的近似副本并考虑其质量,提升AI生成图像检测的可靠性,实验表明其在平衡准确率上平均提升约8%。

Comments Accepted at the APAI Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14973 2026-04-17 cs.CR cs.CV

Robustness of Vision Foundation Models to Common Perturbations

视觉基础模型对常见扰动的鲁棒性

Hongbin Liu, Zhengyuan Jiang, Cheng Hong, Neil Zhenqiang Gong

机构 * Duke University(杜克大学) Ant Group(蚂蚁集团)

AI总结 研究探讨了视觉基础模型对常见扰动的鲁棒性,提出三种鲁棒性指标和五种数学性质,评估了六个行业级模型,发现其普遍不鲁棒,并提出改进方法。

Comments Accepted by CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20645 2026-04-17 cs.CV

PixelDiT: Pixel Diffusion Transformers for Image Generation

PixelDiT:用于图像生成的像素扩散变换器

Yongsheng Yu, Wei Xiong, Weili Nie, Yichen Sheng, Shiqiu Liu, Jiebo Luo

机构 * NVIDIA University of Rochester(罗切斯特大学)

AI总结 PixelDiT提出了一种单阶段端到端模型,直接在像素空间学习扩散过程,提升了图像生成质量与效率,其在ImageNet和文本到图像生成任务中均取得优异成绩。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14762 2026-04-17 cs.CV

OmniGCD: Abstracting Generalized Category Discovery for Modality Agnosticism

OmniGCD:面向模态无关性的泛化类别发现

Jordan Shipard, Arnold Wiliem, Kien Nguyen Thanh, Wei Xiang, Clinton Fookes

机构 * SAIVT, QUT, Australia(萨伊特大学(SAIVT)、昆士兰理工大学(QUT)、澳大利亚) Shield AI, Australia(Shield AI公司、澳大利亚) La Trobe University, Australia(拉特罗布大学、澳大利亚)

AI总结 本文提出OmniGCD,一种模态无关的泛化类别发现方法,通过多模态编码器构建GCD潜在空间,并在零样本设置下提升分类精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14710 2026-04-17 cs.CV

G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval

G-MIXER:基于测地混合的隐式语义扩展和显式语义重新排序用于零样本复合图像检索

Jiyoung Lim, Heejae Yang, Jee-Hyong Lee

机构 * Sungkyunkwan University(顺天大学)

AI总结 G-MIXER通过测地混合生成隐式语义特征并重新排序显式语义,提升零样本复合图像检索的多样性和准确性,实现跨多个基准的最优性能。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14706 2026-04-17 cs.CV

NG-GS: NeRF-Guided 3D Gaussian Splatting Segmentation

NG-GS: 基于NeRF引导的3D高斯点云分割

Yi He, Tao Wang, Yi Jin, Congyan Lang, Yidong Li, Haibin Ling

机构 * Key Laboratory of Big Data and Artificial Intelligence in Transportation, Ministry of Education(交通大数据与人工智能联合实验室,教育部) School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院) Department of Artificial Intelligence, Westlake University(西湖大学人工智能学院)

AI总结 本文提出NG-GS框架,通过掩码方差分析识别边界模糊的高斯点,利用RBF插值和多分辨率哈希编码构建连续特征场,结合NeRF模块实现高质量3D高斯点云分割。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14648 2026-04-17 cs.CV cs.AI cs.LG

Seen-to-Scene: Keep the Seen, Generate the Unseen for Video Outpainting

视见过境:保留已见,生成未见以实现视频外推画布

Inseok Jeon, Minhyeok Lee, Seunghoon Lee, Minseok Kang, Suhwan Cho, Sangyoun Lee

机构 * Yonsei University(延世大学) GenGenAI

AI总结 本文提出Seen-to-Scene框架,结合传播和生成方法提升视频外推画布的时空一致性与视觉真实性,通过流传播和参考引导的潜在传播提高效率和可靠性。

Comments 8 pages, 8 figures (main paper); 9 pages, 10 figures (supplementary). Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14629 2026-04-17 cs.CV

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

Switch-KD:视觉切换知识蒸馏用于视觉-语言模型

Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen

机构 * Li Auto Inc(利-auto公司)

AI总结 Switch-KD通过统一视觉-语言知识转移,解决多模态对齐问题,使小模型高效蒸馏大模型的多模态知识。

Comments 11 pages, 3 figures

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14591 2026-04-17 cs.CV

Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models

基于视觉自回归模型的掩码logit调整的提示引导图像编辑

Amir El-Ghoussani, Marc Hölle, Gustavo Carneiro, Vasileios Belagiannis

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of Surrey(萨里大学)

AI总结 本文提出掩码logit调整方法,通过调整模型预测logits实现提示引导的图像编辑,保留无关区域,提升编辑质量和重建效果,优于现有方法。

Comments Accepted at the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14563 2026-04-17 cs.CV

Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors

重新审视令牌压缩以加速基于ViT的稀疏多视角3D目标检测器

Mingqian Ji, Shanshan Zhang, Jian Yang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学PCA实验室) PCA Lab, School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学PCA实验室)

AI总结 本文提出SEPatch3D框架,通过动态调整拼接块大小和改进特征增强方法,提升基于ViT的稀疏多视角3D目标检测器的推理速度和效率,实验显示其比基线模型快57%且比当前最优方法更高效。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14449 2026-04-17 cs.CV cs.AI

Crowdsourcing of Real-world Image Annotation via Visual Properties

通过视觉属性进行现实世界图像标注的众包

Xiaolei Diao, Fausto Giunchiglia

机构 * University College London(伦敦大学学院) University of Trento(特伦托大学)

AI总结 本文提出结合知识表示、自然语言处理和计算机视觉技术的图像标注方法,通过视觉属性约束减少标注偏差,采用交互式众包框架动态提问以优化标注过程。

Journal ref AI4RWC@CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14433 2026-04-17 cs.CV cs.LG

Zero-Ablation Overstates Register Content Dependence in DINO Vision Transformers

零消融高估了DINO视觉变换器中注册内容的依赖性

Felipe Parodi, Jordan Matelsky, Melanie Segado

机构 * University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室)

AI总结 研究通过零消融实验发现,DINOv2+和DINOv3的注册内容对分类和分割任务至关重要,但其他替换控制方法如均值替换、噪声替换和跨图像注册洗牌能保持性能,表明注册内容并非绝对必要。

Comments 12 pages, 10 figures, to be published in CVPR 2026 HOW Vision Interpretability Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14259 2026-04-17 q-bio.TO cs.LG eess.IV

Continual Learning for fMRI-Based Brain Disorder Diagnosis via Functional Connectivity Matrices Generative Replay

基于功能性连接矩阵生成性重放的fMRI脑部疾病诊断持续学习

Qianyu Chen, Shujian Yu

机构 * Nanyang Technological University(南洋理工大学) VU Amsterdam(阿姆斯特丹大学) UiT The Arctic University of Norway(北欧大学)

AI总结 本文提出首个针对异构临床站点的fMRI诊断持续学习框架,通过生成对抗网络生成真实功能性连接矩阵,并结合多级知识蒸馏策略和分层上下文老虎机方案,有效缓解灾难性遗忘问题。

Comments manuscript accepted by CVPR 2026, code is available from \url{https://github.com/4me808/FORGE}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12580 2026-04-17 cs.CV

PDF-GS: Progressive Distractor Filtering for Robust 3D Gaussian Splatting

PDF-GS:渐进式干扰过滤用于鲁棒的3D高斯点划法

Kangmin Seo, MinKyu Lee, Tae-Young Kim, ByeongCheol Lee, JoonSeoung An, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

AI总结 PDF-GS通过渐进多阶段优化增强3D高斯点划法的自过滤能力,有效去除干扰,实现高质量重建,优于现有方法。

Comments Accepted to CVPR Findings 2026. Project Page: https://kangrnin.github.io/PDF-GS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05541 2026-04-17 cs.CV

EchoAgent: Towards Reliable Echocardiography Interpretation with "Eyes","Hands" and "Minds"

EchoAgent:迈向可靠超声心动图解读的“眼、手、脑”系统

Qin Wang, Zhiqing He, Yu Liu, Bowen Guo, Zeju Li, Miao Zhao, Wenhao Ju, Zhiling Luo, Xianhong Shu, Yi Guo, Yuanyuan Wang

机构 * Fudan University(复旦大学) Fudan Zhongshan Hospital(复旦中山医院) Fuwai Yunnan Hospital(阜外云南医院) Fuwai Beijing Hospital(阜外北京医院)

AI总结 本文提出EchoAgent,通过整合视觉、手动操作与专家知识,实现端到端的超声心动图解读,提升临床可靠性与实用性。

Comments Accepted by CVPR 2026 CV4Clinical, 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20328 2026-04-17 cs.CV eess.IV math.OC

GSNR: Graph Smooth Null-Space Representation for Inverse Problems

GSNR:图平滑空域表示用于逆问题

Romario Gualdrón-Hurtado, Roman Jacome, Rafael S. Suarez, Henry Arguello

机构 * Universidad Industrial de Santander(圣安德烈大学)

AI总结 本文提出GSNR方法,通过在不可见成分中施加结构,解决逆问题中空域信息约束不足的问题,提升重建精度。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)

Journal ref Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17417 2026-04-17 cs.LG cs.AI

Generative Modeling of Class Probability for Multi-Modal Representation Learning

多模态表示学习中的类别概率生成建模

Jungkyoo Shin, Bumsoo Kim, Eunwoo Kim

机构 * Department of AI(人工智能系) School of CSE(计算机科学与工程学院) Chung-Ang University(Chung-Ang 大学)

AI总结 本文提出了一种基于类别概率分布的多模态表示学习方法CALM,通过生成和对齐类别概率分布提升多模态对齐效果,并引入跨模态概率变分自编码器以增强模态间关系的建模能力。

Comments To appear in CVPR 2025 (Highlight)

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2025, pp. 20737-20746

详情

展开后加载摘要…

URL PDF HTML 收藏