arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-06-05 至 2026-06-05 共收录 15
2606.06375 2026-06-05 cs.AI

Rethinking Infrastructure Inspection as Image Difference Classification: A Traffic Sign Case Study

重新思考基础设施检测为图像差异分类:以交通标志为例

Ching Yau Fergus Mok, Lavindra de Silva, Varun Kumar Reja, Ioannis Brilakis

机构 * University of Cambridge(剑桥大学) IIT Bombay(印度理工学院Bombay)

AI总结 本研究将基础设施检测重新定义为图像差异分类(IDC),通过利用连续资产状态监测的关系性质减少数据依赖,并在低资源交通标志检测案例中验证了基于指令的分类器优于基于编码器的分类器。

Comments CVPR 2026 Computer Vision for the Built World Workshop (CV4AEC @ CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05703 2026-06-05 cs.CV

Parallel Jacobi Decoding for Fast Autoregressive Image Generation

并行雅可比解码用于快速自回归图像生成

Boya Liao, Ying Li, Siyong Jian, Huan Wang

机构 * Westlake University(西交利物浦大学)

AI总结 提出并行雅可比解码(PJD),通过二维空间域扩展草稿令牌并调整注意力掩码,实现无需训练的自回归图像生成加速,在保持生成质量的同时获得4.8倍至6.4倍加速。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05695 2026-06-05 cs.LG

Revisiting Prototype Rehearsal for Exemplar-Free Continual Learning: Manifold-Aware Boundary Sampling with Adaptive Class-Balanced Loss

重新审视原型重放用于无样本持续学习:基于流形感知边界采样与自适应类别平衡损失

Hongye Xu, Bartosz Krawczyk

机构 * Chester F. Carlson Center for Imaging Science(切斯特·F·卡森成像科学中心) Rochester Institute of Technology(罗切斯特理工学院)

AI总结 针对无样本类增量学习,提出流形感知边界采样和自适应类别平衡损失,通过生成边界感知重放样本和动态调整类别权重,使原型重放方法恢复竞争力并达到最先进性能。

Comments Published in CVPR 2026 Findings. 10 pages, 6 figures. CVF version: https://openaccess.thecvf.com/content/CVPR2026F/html/Xu_Revisiting_Prototype_Rehearsal_for_Exemplar-Free_Continual_Learning_Manifold-Aware_Boundary_Sampling_CVPRF_2026_paper.html. Code: https://github.com/HXuSz11/ACB_CEOS_CVPR2026_Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05359 2026-06-05 cs.CV

Recovering Physically Plausible Human-Object Interactions from Monocular Videos

从单目视频中恢复物理上可信的人-物交互

Dingbang Huang, Etienne Vouga, Qixing Huang, Georgios Pavlakos

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出RePHO方法,通过物理引导的重建框架和强化学习策略,从单目视频中恢复物理上可信的人-物交互,解决了现有方法中的穿透和物体漂浮问题。

Comments CVPR 2026. Project Page: https://dingbang777.github.io/RePHO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00522 2026-06-05 cs.CV

A Trajectory-Driven Spatio-Temporal Refinement Solution for CVPR 2026 8th UG2+ Challenge Track 3: DOST

CVPR 2026 第八届 UG2+ 挑战赛赛道三:湍流中动态目标分割的有效解决方案

Hongzhen Li, Miao Yu, Leilei Cao, Youwei Pan, Yingfang Zhu, Fengjie Zhu

机构 * TEX AI, Transsion Holdings(TEX AI,Transsion控股)

AI总结 基于 SegAnyMo 框架,通过数据域自适应和时空后处理模块,提升严重大气畸变下的动态目标分割性能,在挑战赛中获第二名。

Comments 4 pages, 1 figure, CVPR 2026 8th UG2+ Challenge Track 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24481 2026-06-05 cs.CV

OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

OmniEgo-R$^2$:面向CVPR 2026首届跨领域EgoCross挑战赛的路由推理框架

Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 针对跨领域自我中心视频推理中的时间边界模糊、语义粒度不匹配和决策不稳定问题,提出OmniEgo-R$^2$路由推理框架,在Source-Limited和Open-Source赛道均获第二名。

Comments Technical Report for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24500 2026-06-05 cs.CV

EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge

EgoAdapt: CVPR 2026 HD-EPIC VQA挑战赛的多场景自我中心适应方法

Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Guozhi Qiu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 提出EgoAdapt方法,通过类别条件路由、校准选项评分和测试时一致性适应,解决自我中心视频问答中通用推理与异构时空语义结构不匹配的问题。

Comments Technical Report for CVPR 2026 HD-EPIC VQA Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24496 2026-06-05 cs.CV

EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026

EgoAction: 面向 EPIC-KITCHENS 动作检测挑战的可靠性感知时间融合自我中心动作组合 (CVPR 2026)

Zhiheng Fu, Zixu Li, Zhiwei Chen, Fangxu Liu, Yupeng Hu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 提出 EgoAction 统一解耦检测与融合流水线,通过动态加权融合(DWF)自适应组合动词和名词检测流,解决自我中心视频中动作边界定位的可靠性问题。

Comments Technical Report for CVPR 2026 EPIC-KITCHENS-100 Action Detection Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24470 2026-06-05 cs.CV

TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge

TempRet: 面向CVPR 2026 EPIC-KITCHENS-100多实例检索挑战的时间增强与两阶段重排序

Zixu Li, Yupeng Hu, Zhiwei Chen, Zhiheng Fu, Xiaowei Zhu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 针对第一人称视频检索中时间动态被忽视的问题,提出基于CLIP双编码器、视频端时间Transformer和两阶段重排序的TempRet方法,在EK-100 MIR基准上达到67.97%平均mAP和82.92%平均nDCG。

Comments Technical Report for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10528 2026-06-05 cs.CV

BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs

BareBones: 视觉语言模型中零样本几何理解的基准测试

Aaditya Baranwal, Vishal Yadav, Abhishek Rajora

机构 * University of Central Florida(佛罗里达大学中央分校) University of Calgary(卡尔加里大学)

AI总结 提出BareBones基准,通过去除RGB纹理仅保留轮廓,测试26个视觉语言模型在零样本几何形状理解上的表现,发现模型存在严重的纹理偏置悬崖。

Comments Accepted at CVPR (13th FGVC Workshop) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06052 2026-06-05 cs.CV

Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models

注意,我可以请你决定吗?定位扩散模型中的生成选择

Katarzyna Zaleska, Łukasz Popek, Monika Wysoczańska, Kamil Deja

机构 * Warsaw University of Technology(华沙技术大学) valeo.ai IDEAS Research Institute(IDEAS研究所)

AI总结 本文提出基于探测的定位技术,发现自注意力层是解决模糊概念的关键,并设计ICM方法通过干预少量自注意力层实现精确去偏。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09706 2026-06-05 cs.LG

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

通过强化学习训练一个模型以掌握跨层级的代理行为

Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出CrossHA,一种统一的代理模型,能够掌握异构的动作空间并自主选择每一步轨迹中最有效的接口,通过结合冷启动监督微调和多轮组相对策略优化(GRPO)算法,实现适应性动作切换,在Minecraft开放世界中超过800个任务上展示了最先进的性能。

Comments Accepted to CVPR 2026 as a Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01734 2026-06-05 cs.CR cs.AI

Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning

对抗代理:基于强化学习的黑盒逃逸攻击

Kyle Domico, Jean-Charles Noirot Ferrand, Ryan Sheatsley, Eric Pauley, Josiah Hanna, Patrick McDaniel

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文提出了一种基于强化学习的对抗攻击方法,通过学习生成对抗样本的新算法,提高了攻击效率和成功率,同时在图像分类基准上展示了其优越的性能。

Comments Accepted to the Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12336 2026-06-05 cs.CV

Unsupervised Monocular 3D Keypoint Discovery from Multi-View Diffusion Priors

无监督单目多视图扩散先验的3D关键点发现

Subin Jeon, In Cho, Junyoung Hong, Woong Oh Cho, Seon Joo Kim

机构 * Yonsei University(延世大学)

AI总结 本文提出KeyDiff3D框架,通过单张图像准确预测3D关键点,利用预训练的多视图扩散模型中的几何先验,将隐式3D先验转化为显式3D特征体,实现关键点估计和3D对象操控。

Comments Accepted at CVPR 2026. Project page: https://subin6.github.io/keydiff3d-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23300 2026-06-05 cs.CV cs.RO

Learning Predictive Visuomotor Coordination

学习预测性视觉-运动协调

Wenqi Jia, Bolin Lai, Miao Liu, Danfei Xu, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Tech(佐治亚理工学院) Meta AI

AI总结 本文提出了一种基于预测的视觉-运动协调建模任务,通过结合第一人称视觉和运动学观测预测头部姿态、目光方向和上半身运动,展示了多模态整合在理解视觉-运动协调中的重要性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏