arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-05 至 2026-05-05 共收录 12
2605.01657 2026-05-05 cs.CV

Act2See: Emergent Active Visual Perception for Video Reasoning

Act2See:面向视频推理的涌现式主动视觉感知

Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

AI总结 本文提出Act2See框架,通过使VLMs在文本推理中主动交错视频帧,实现视频推理中的主动视觉感知,提升了推理质量并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01638 2026-05-05 cs.CV

Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection

Omni-Fake:面向社交媒体的统一多模态深度伪造检测基准测试

Tianxiao Li, Zhenglin Huang, Haiquan Wen, Yiwei He, Xinze Li, Bingyu Zhu, Wuhui Duan, Congang Chen, Zeyu Fu, Yi Dong, Baoyuan Wu, Jason Li, Guangliang Cheng

机构 * University of Liverpool(利物浦大学) University of Exeter(埃克塞特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Omni-Fake多模态深度伪造检测基准,包含大规模数据集和分布外基准,支持联合检测-定位-解释协议,并提出基于强化学习的多模态检测器,提升检测准确性和可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01498 2026-05-05 cs.CV

Towards Visual Query Localization in the 3D World

面向3D世界的视觉查询定位

Liang Peng, Bohan Tan, Zhipeng Zhang, Haobo Li, Yifan Jiao, Xingping Dong, Libo Zhang

机构 * Wuhan University(武汉大学) AutoLab, SAI, Shanghai Jiao Tong University(AutoLab、SAI、上海交通大学) Anyverse Dynamics University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文首次提出3D多模态视觉查询定位基准3DVQL,包含2002个序列和17万帧数据,通过点云、RGB图像和深度图像多模态数据提升研究灵活性,并提出LaF算法提升性能。

Comments Accepted to CVPR 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01468 2026-05-05 cs.CV cs.AI

Decision Boundary-aware Generation for Long-tailed Learning

面向长尾学习的决策边界感知生成

Jiacheng Yang, Ruichi Zhang, Chikai Shang, Mengke Li, Xinyi Shang, Junlong Gao, Yonggang Zhang, Yang Lu

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(中国教育部多媒体可信感知与高效计算重点实验室) Xiamen University(厦门大学) College of Computer Science and Software Engineering(计算机科学与软件工程学院) Shenzhen University(深圳大学) Department of Statistical Science(统计科学系) University College London(伦敦大学学院) Division of Arts and Machine Creativity(艺术与机器创造力 division) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出DBG框架,通过生成边界附近样本提升表示学习,缓解长尾数据分布不均问题,提升尾类和整体准确率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01450 2026-05-05 cs.CV

Registration-Free Learnable Multi-View Capture of Faces in Dense Semantic Correspondence

无需注册的可学习多视角面部密集语义对应捕捉

Panagiotis P. Filntisis, George Retsinas, Radek Daněček, Vanessa Sklyarova, Petros Maragos, Timo Bolkart

机构 * Institute of Robotics, Athena Research Center(机器人研究所,雅典研究中心) School of ECE, NTUA(电子工程学院,NTUA) HERON – Hellenic Robotics Center of Excellence(希腊机器人 excellence 中心) MPI for Intelligent Systems(智能系统研究所) ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

AI总结 本文提出MOCHI框架,无需注册数据直接从多视角图像预测3D面部,通过伪线性逆运动学求解器确保拓扑一致性,改进损失函数提升重建精度。

Comments 19 pages, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01325 2026-05-05 cs.CV cs.LG

Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance

通过格罗莫夫-瓦瑟斯坦距离重新思考VLM中的模型选择

Muyang Li, Yucheng Liu, Jianbo Ma, Elliot Osborne, Bo Han, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Dolby Laboratories(杜比实验室) TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体)

AI总结 本文通过系统实验探讨视觉编码器选择的关键因素,发现模态间结构相似性通过格罗莫夫-瓦瑟斯坦距离衡量能提升VLM性能预测。

Comments Accepted as Highlight publication for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01309 2026-05-05 cs.CV

CUE: Concept-Aware Multi-Label Expansion to Mitigate Concept Confusion in Long-Tailed Learning

CUE: 基于概念的多标签扩展以缓解长尾学习中的概念混淆

Ruichi Zhang, Chikai Shang, Jiacheng Yang, Mengke Li, Yang Zhou, Junlong Gao, Yang Lu

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Institute of High Performance Computing, A*STAR, Singapore(新加坡A*STAR高性能计算研究所)

AI总结 本文提出CUE,通过引入多标签概念信号缓解长尾分布下类别间关系的破坏,实验表明其在多个长尾基准上表现优异。

Comments 10 pages. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00871 2026-05-05 eess.SP cs.AI cs.CV cs.LG

NAKUL-Med: Spectral-Graph State Space Models with Dynamics Kernels for Medical Signals

NAKUL-Med: 带动态核的谱-图状态空间模型用于医学信号

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

AI总结 NAKUL-Med通过动态核生成、谱上下文建模和图引导的空间注意力,提升多通道生理信号分析的性能,实现高准确率和高效推理。

Comments Accepted CVPR Finding Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00832 2026-05-05 cs.CV cs.LG

Synthetic Designed Experiments for Diagnosing Vision Model Failure

合成设计实验用于诊断视觉模型失效

Krisanu Sarkar

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

AI总结 本文提出SDRS方法,通过方差分析分解高效审计模型的因子敏感性,识别并解决类型I和II失效缺口,通过针对性合成数据提升模型性能。

Comments Under review at CVPR SynData4CV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27437 2026-05-05 cs.CV

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

SpatialStack:用于3D VLM空间推理的分层几何-语言融合

Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan

机构 * XMU(厦门大学) UCLA(美国大学) Google(谷歌) UW-Madison(威斯康星大学麦迪逊分校) TAMU(德克萨斯农工大学)

AI总结 本文提出SpatialStack框架,通过分层融合视觉、几何和语言表征,提升3D空间推理能力,实验表明其在多个基准上表现优异。

Comments CVPR 2026, Project Website: https://spatial-stack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09625 2026-05-05 cs.CV cs.AI

Grounding Synthetic Data Generation With Vision and Language Models

基于视觉和语言模型的合成数据生成基础

Ümit Mert Çağlar, Alptekin Temizel

机构 * Graduate School of Informatics(信息学院)

AI总结 本文提出一种视觉-语言 grounded 框架,用于可解释的遥感合成数据增强与评估,引入 ARAS400k 数据集,包含 100k 真实图像和 300k 合成图像,用于语义分割和图像描述生成。

Comments Accepted for presentation at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Synthetic Data for Computer Vision Workshop (SynData4CV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17340 2026-05-05 cs.CV

Refracting Reality: Generating Images with Realistic Transparent Objects

折射现实:生成具有真实透明物体的图像

Yue Yin, Enze Tao, Dylan Campbell

机构 * The Australian National University(澳大利亚国立大学)

AI总结 本文提出通过Snell定律在生成过程中同步像素,生成更符合物理约束的透明物体图像。

Comments CVPR 2026 (Highlight), Code: https://github.com/YueYin27/snellcaster, Project page: https://yueyin27.github.io/snellcaster-page/

详情

展开后加载摘要…

URL PDF HTML 收藏