arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-26 至 2026-03-26 共收录 39
2603.22492 2026-03-26 cs.CV cs.AI cs.MM

Tiny Inference-Time Scaling with Latent Verifiers

微小推理时间缩放与潜在验证器

Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

AI总结 本文提出VHS验证器,直接在扩散变换器单步生成器的中间隐藏表示上操作,减少验证成本并提升性能,实现更高效的推理时间缩放。

Comments Findings of CVPR 2026 - Code at: https://aimagelab.github.io/VHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13904 2026-03-26 cs.CV cs.AI cs.LG cs.RO

Pixel-level Scene Understanding in One Token: Visual States Need What-is-Where Composition

单个token中的像素级场景理解:视觉状态需要什么在哪里的组成

Seokmin Lee, Yunghee Lee, Byeonghyun Pak, Byeongju Woo

机构 * Agency for Defense Development(国防发展机构)

AI总结 本文提出CroBo框架,通过全局到局部重建目标,学习能捕捉场景元素语义身份和空间位置的视觉状态表示,以支持连续决策。

Comments Accepted to CVPR 2026 Workshop: Pixel-level Video Understanding in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11380 2026-03-26 cs.CV

DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding

DriveXQA: 多模态视觉问答用于恶劣驾驶场景理解

Mingzhe Tao, Ruiping Liu, Junwei Zheng, Yufan Chen, Kedi Ying, M. Saquib Sarfraz, Kailun Yang, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新)

AI总结 本文提出DriveXQA多模态数据集,用于自主驾驶场景中的视觉问答,通过融合多传感器信息提升对异常驾驶场景的理解能力。

Comments Accepted to CVPR DriveX Workshop. Dataset and Code: https://github.com/jtjmd/DRIVEXQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22212 2026-03-26 cs.CV

Neu-PiG: Neural Preconditioned Grids for Fast Dynamic Surface Reconstruction on Long Sequences

Neu-PiG:神经预条件网格用于长序列快速动态表面重建

Julian Kaltheuner, Hannah Dröge, Markus Plack, Patrick Stotko, Reinhard Klein

机构 * University of Bonn(波恩大学)

AI总结 本文提出Neu-PiG,通过预条件潜在网格编码实现快速动态表面重建,解决了长序列中点云数据的一致性问题,提升精度和效率。

Comments CVPR 2026, Code: https://github.com/vc-bonn/neu-pig

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19900 2026-03-26 cs.CV cs.GR

ExpPortrait: Expressive Portrait Generation via Personalized Representation

ExpPortrait:通过个性化表示生成表现力强的肖像

Junyi Wang, Yudong Guo, Boyang Guo, Shengming Yang, Juyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一种高保真个性化头部表示,用于生成具有高表现力的肖像视频,通过引入表达转移模块实现不同身份间的头部姿态和表情细节转移,实验表明在身份保持、表情准确性和时间稳定性方面优于现有方法。

Comments CVPR 2026, Project Page: https://ustc3dv.github.io/ExpPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18996 2026-03-26 cs.CV

Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction

通过循环一致性掩码预测学习跨视角物体对应关系

Shannan Yan, Leqi Zheng, Keyu Lv, Jingchen Ni, Hongyang Wei, Jiajun Zhang, Guangting Wang, Jing Lyu, Chun Yuan, Fengyun Rao

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室) USTC(中国科学技术大学)

AI总结 本文提出基于条件二值分割的框架,通过循环一致性训练目标视角预测掩码并重建源视角掩码,实现无标注的自监督学习,提升跨视角物体对应性能。

Comments The paper has been accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04000 2026-03-26 cs.CV cs.AI cs.LG

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

分割后再地面:为长视频理解适应帧选择以查询类型

Jialuo Li, Bin Li, Jiahao Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出DIG框架,根据查询类型调整帧选择策略,通过高效均匀采样处理全局查询,利用专用流程提取相关帧处理局部查询,提升长视频理解性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18370 2026-03-26 cs.CV cs.GR

MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer

MimiCAT:基于对应感知级联变换器的无类别3D姿态迁移

Zenghao Chai, Chen Tang, Yongkang Wong, Xulei Yang, Mohan Kankanhalli

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Institute for Infocomm Research, A ∗ STAR(资讯通信研究院(A*STAR))

AI总结 本文提出MimiCAT模型,通过语义关键点标签学习软对应关系,实现无类别3D姿态迁移,提升跨形态姿态转换的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026. Project page: https://mimicat3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15087 2026-03-26 cs.CV cs.CL cs.LG

Phrase-Instance Alignment for Generalized Referring Segmentation

短语-实例对齐用于通用指称分割

E-Ro Nguyen, Hieu Le, Dimitris Samaras, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳州立大学 Charlotte 分校)

AI总结 本文提出通过短语-实例对齐解决通用指称分割问题,通过实例级推理和POA损失实现精确对应,提升分割性能。

Comments Accepted to PVUW - CVPR 2026 Workshop. Webpage: https://eronguyen.github.io/InstAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏