arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-06 至 2026-04-06 共收录 28
2604.03198 2026-04-06 cs.CV

The Eleventh NTIRE 2026 Efficient Super-Resolution Challenge Report

2026年NTIRE高效超分辨率挑战赛报告

Bin Ren, Hang Guo, Yan Shu, Jiaqi Ma, Ziteng Cui, Shuhong Liu, Guofeng Mei, Lei Sun, Zongwei Wu, Fahad Shahbaz Khan, Salman Khan, Radu Timofte, Yawei Li, Hongyuan Yu, Pufan Xu, Chen Wu, Long Peng, Jiaojiao Yi, Siyang Yi, Yuning Cui, Jingyuan Xia, Xing Mou, Keji He, Jinlin Wu, Zongang Gao, Sen Yang, Rui Zheng, Fengguo Li, Yecheng Lei, Wenkai Min, Jie Liu, Keye Cao, Shubham Sharma, Manish Prasad, Haobo Li, Matin Fazel, Abdelhak Bentaleb, Rui Chen, Shurui Shi, Zitao Dai, Qingliang Liu, Yang Cheng, Jing Hu, Xuan Zhang, Rui Ding, Tingyi Zhang, Hui Deng, Mengyang Wang, Fulin Liu, Jing Wei, Qian Wang, Hongying Liu, Mingyang Li, Guanglu Dong, Zheng Yang, Chao Ren, Hongbo Fang, Lingxuan Li, Lin Si, Pan Gao, Moncef Gabbouj, Watchara Ruangsang, Supavadee Aramvith

AI总结 本文回顾了2026年NTIRE高效单幅图像超分辨率挑战赛,总结了参赛方案与结果,旨在设计保持PSNR性能的高效网络。

Comments CVPR 2026 NTIRE Workshop Paper, Efficient Super Resolution Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03179 2026-04-06 cs.LG cs.AI cs.CV

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

理解强化学习在多模态推理模型后训练中幻觉的作用

Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Arizona State University(亚利桑那州立大学) Honda Research Institute, USA(本田美国研究所)

AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03069 2026-04-06 cs.CV

SparseSplat: Towards Applicable Feed-Forward 3D Gaussian Splatting with Pixel-Unaligned Prediction

SparseSplat: 向可应用的前馈3D高斯点划法迈进:像素不齐预测

Zicheng Zhang, Xiangting Meng, Ke Wu, Wenchao Ding

机构 * Fudan University(复旦大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出SparseSplat,首个可适应场景结构和局部区域信息丰富度的前馈3D高斯点划法模型,生成紧凑的3DGS地图,实验表明其在22%和1.5%的高斯数量下均能获得优异渲染质量。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02946 2026-04-06 cs.CV cs.AI cs.LG

Learning from Synthetic Data via Provenance-Based Input Gradient Guidance

通过基于溯源的输入梯度引导学习合成数据

Koshiro Nagano, Ryo Fujii, Ryo Hachiuma, Fumiaki Sato, Taiki Sekii, Hideo Saito

机构 * Keio University(庆应义塾大学) Independent Researcher(独立研究员) CyberAgent

AI总结 本文提出利用训练数据合成过程中的溯源信息作为辅助监督信号,通过分解输入梯度抑制非目标区域,提升模型对目标区域的判别能力,验证了方法在多任务和多模态中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02905 2026-04-06 cs.CV

UniSpector: Towards Universal Open-set Defect Recognition via Spectral-Contrastive Visual Prompting

UniSpector:通过频谱-对比视觉提示实现通用开放集缺陷识别

Geonuk Kim, Minhoi Kim, Kangil Lee, Minsu Kim, Hyeonseong Jeon, Jeonghoon Han, Hyoungjoon Lim, Junho Yim

机构 * LG Energy Solution(LG新能源)

AI总结 UniSpector通过设计语义结构化的提示拓扑,解决工业检测中开放集缺陷识别的问题,其在AP50b和AP50m上优于基线19.7%和15.8%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02877 2026-04-06 cs.CV

Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework

解锁增量学习手术仪器中的正向迁移:一种自反思分层提示框架

Yu Zhu, Kang Li, Zheng Li, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出自反思分层提示框架,通过正向和反向知识迁移提升手术仪器增量分割性能,改进现有技能并避免灾难性遗忘。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02870 2026-04-06 cs.CV

Token Warping Helps MLLMs Look from Nearby Viewpoints

令牌扭曲帮助多模态大语言模型从近处视角观察

Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。

Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02860 2026-04-06 cs.CV cs.AI

A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos

范式转变:面向视频中的时序句子定位的端到端训练

Allen He, Qi Liu, Kun Liu, Xinchen Liu, Wu Liu

机构 * BASIS International School Park Lane Harbour(贝赛思国际学校(公园港)) UCAS(中国科学院大学) JD Explore Academy(京东探索研究院) USTC(中国科学技术大学)

AI总结 本文提出一种端到端训练范式,联合优化视频主干网络和定位头,通过引入Sentence Conditioned Adapter提升视觉表征,实验表明优于现有方法。

Comments Accepted as CVPR 2026 Workshop PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02845 2026-04-06 cs.CV

Deformation-based In-Context Learning for Point Cloud Understanding

基于变形的点云情境学习

Chengxing Lin, Jinhong Deng, Yinjie Lei, Wen Li

机构 * Shenzhen Institute for Advanced Study, UESTC(电子科技大学深圳高等研究院) School of Computer Science and Engineering, UESTC(电子科技大学计算机科学与工程学院) Sichuan University(四川大学)

AI总结 本文提出DeformPIC框架,通过任务引导变形查询点云以实现点云情境学习,改进几何推理和一致性目标,实验显示在重建、去噪和配准任务中均优于现有方法。

Comments Accepted by CVPR 2026. Code: https://github.com/linchengxing/DeformPIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02780 2026-04-06 cs.CV

A Unified Perspective on Adversarial Membership Manipulation in Vision Models

视觉模型中对抗性成员操纵的统一视角

Ruize Gao, Kaiwen Zhou, Yongqiang Chen, Feng Liu

机构 * Knowin AI The Chinese University of Hong Kong(香港中文大学) The University of Melbourne(墨尔本大学)

AI总结 本文探讨了视觉模型中对抗性成员操纵现象,揭示其几何特征并提出检测与防御策略,提升模型鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02719 2026-04-06 cs.CV cs.AI cs.LG

MOMO: Mars Orbital Model Foundation Model for Mars Orbital Applications

MOMO:用于火星轨道应用的火星轨道基础模型

Mirali Purohit, Bimal Gajera, Irish Mehta, Bhanu Tokas, Jacob Adler, Steven Lu, Scott Dickenshied, Serina Diniega, Brian Bue, Umaa Rebbapragada, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室)

AI总结 MOMO是首个多传感器基础模型,通过模型融合整合来自HiRISE、CTX和THEMIS三种关键火星传感器的数据,提升多分辨率数据的稳定性和泛化能力。

Comments Accepted at CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02654 2026-04-06 cs.CV

Drift-Resilient Temporal Priors for Visual Tracking

具有抗漂移特性的时序先验用于视觉跟踪

Yuqing Huang, Liting Lin, Weijun Zhuang, Zhenyu He, Xin Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Lero, the Research Ireland Centre for Software, University of Limerick(Lero,爱尔兰软件研究中心,利默里克大学) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

AI总结 本文提出DTPTrack模块,通过时序可靠性校准和时序指导合成方法,提升多帧跟踪器的抗漂移能力,在三个不同架构上均取得显著性能提升。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02616 2026-04-06 cs.CV

Unlocking Multi-Site Clinical Data: A Federated Approach to Privacy-First Child Autism Behavior Analysis

解锁多站点临床数据:一种以隐私为中心的联邦学习方法用于儿童自闭症行为分析

Guangyu Sun, Wenhan Wu, Zhishuai Guo, Ziteng Wang, Pegah Khosravi, Chen Chen

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) Department of Clinical Sciences, College of Medicine, University of Central Florida(中佛罗里达大学医学院临床科学系) Department of Computer Science, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校计算机科学系) Department of Computer Science, Northern Illinois University(北伊利诺伊大学计算机科学系) Industrial and Systems Engineering, Northern Illinois University(北伊利诺伊大学工业与系统工程系)

AI总结 本文提出利用联邦学习进行基于姿态的儿童自闭症行为识别,通过隐私保护机制和多站点数据协作,实现高准确率的隐私优先解决方案。

Comments Accepted on the CVPR 2026 Workshop on Computer Vision for Children (CV4CHL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02605 2026-04-06 cs.AI cs.SD

Do Audio-Visual Large Language Models Really See and Hear?

音频视觉大语言模型真的能看见和听见吗?

Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02603 2026-04-06 cs.CV

Rascene: High-Fidelity 3D Scene Imaging with mmWave Communication Signals

Rascene:利用毫米波通信信号实现高保真3D场景成像

Kunzhe Song, Geo Jie Zhou, Xiaoming Liu, Huacheng Zeng

机构 * Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

AI总结 本文提出Rascene框架,利用毫米波通信信号实现高精度3D场景成像,克服了传统传感器在恶劣环境下的局限性,提供了一种低成本、可扩展的3D感知新途径。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02532 2026-04-06 cs.CV cs.AI cs.LG

Feature Attribution Stability Suite: How Stable Are Post-Hoc Attributions?

特征归因稳定性套件:后验归因的稳定性如何?

Kamalasankari Subramaniakuppusamy, Jugal Gajjar

机构 * The George Washington University(乔治华盛顿大学)

AI总结 本文提出FASS基准,通过预测不变过滤分解稳定性为结构相似度、排名相关性和top-k Jaccard重叠,评估四种归因方法在不同扰动下的稳定性,发现几何扰动比光度扰动更具不稳定性。

Comments Accepted in the proceedings track of XAI4CV Workshop at CVPR 2026. It has 2 images, 5 tables, 6 equations, and 35 references in the main paper and 12 figures, 15 tables, and 3 references in the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26584 2026-04-06 cs.CV

Scene Grounding In the Wild

野外场景的场景定位

Tamir Cohen, Leo Segre, Shay Shomer-Chai, Shai Avidan, Hadar Averbuch-Elor

机构 * Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

AI总结 本文提出一种框架,通过将部分重建与完整的参考模型对齐,提升无视觉重叠时的大尺度场景重建一致性。方法基于伪合成渲染,利用3D高斯点云和逆特征优化,引入WikiEarth数据集验证效果。

Comments CVPR 2026. Project page at https://tau-vailab.github.io/SceneGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23032 2026-04-06 cs.CV cs.RO

Generative Event Pretraining with Foundation Model Alignment

基于基础模型对齐的生成事件预训练

Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人感知组)

AI总结 本文提出GEP框架,通过将互联网级图像数据集中的语义知识迁移到事件数据,并学习事件特有的时间动态,提升事件视觉基础模型在跨任务迁移学习中的性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20554 2026-04-06 cs.CV

When Negation Is a Geometry Problem in Vision-Language Models

当否定是在视觉-语言模型中一个几何问题

Fawaz Sammani, Tzoulio Chamiti, Paul Gavrikov, Nikos Deligiannis

机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO系) imec Independent Researcher(独立研究员)

AI总结 本文探讨了视觉-语言模型中否定理解的几何问题,提出基于多模态大语言模型的评估框架,并通过表示工程操控CLIP模型实现否定意识。

Comments Accepted to CVPR (Multimodal Algorithmic Reasoning Workshop) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14267 2026-04-06 cs.CV cs.AI cs.MM cs.SD

DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization

DiFlowDubber:通过跨模态对齐与同步实现的离散流匹配自动化视频配音

Ngoc-Son Nguyen, Thanh V. T. Tran, Jeongsoo Choi, Hieu-Nghia Huynh-Nguyen, Truong-Son Hy, Van Nguyen

机构 * FPT Software AI Center, Vietnam(FPT软件人工智能中心,越南) KAIST, South Korea(韩国科学技术院) University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校)

AI总结 本文提出DiFlowDubber框架,通过离散流匹配和两阶段训练策略,解决视频配音中内容准确性、表达语气、高质量音频和精确唇同步的问题。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12711 2026-04-06 cs.CV

Text-Phase Synergy Network with Dual Priors for Unsupervised Cross-Domain Image Retrieval

带有双先验的文本-相位协同网络用于无监督跨域图像检索

Jing Yang, Hui Xue, Shipeng Zhu, Pengfei Fang

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))

AI总结 本文提出TPSNet,通过结合文本先验和相位先验,提升无监督跨域图像检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16672 2026-04-06 cs.CV

ReWeaver: Towards Simulation-Ready and Topology-Accurate Garment Reconstruction

ReWeaver:面向仿真准备和拓扑准确的服装重建

Ming Li, Hui Shan, Kai Zheng, Chentao Shen, Siyu Liu, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Fudan University(复旦大学) Adobe Xidian University(西安电子科技大学)

AI总结 ReWeaver通过稀疏多视角图像实现拓扑准确的3D服装和缝纫图案重建,提升仿真和机器人应用的精度与一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07951 2026-04-06 cs.CV

Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality

保留源视频真实性:面向电影质量的高保真面部交换

Zekai Luo, Zongze Du, Zhouhang Zhu, Hao Zhong, Muzhi Zhu, Wen Wang, Yuling Xi, Chenchen Jing, Hao Chen, Chunhua Shen

机构 * Zhejiang University, State Key Laboratory of CAD & CG(浙江大学,计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学) Ant Group(蚂蚁集团)

AI总结 本文提出LivingSwap模型,通过关键帧和视频参考引导实现高保真面部交换,提升视频真实感与时间一致性,减少生产流程中的手动工作量。

Comments Accepted to CVPR 2026. Project webpage: https://aim-uofa.github.io/LivingSwap

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00961 2026-04-06 cs.LG

Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

通过视频扩散模型实现目标驱动的奖励用于强化学习

Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) Zhongguancun Academy(中关村学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)

AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。

Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23292 2026-04-06 cs.CV cs.GR

FACT-GS: Frequency-Aligned Complexity-Aware Texture Reparameterization for 2D Gaussian Splatting

FACT-GS:频率对齐的复杂度感知纹理重参数化用于2D高斯点划法

Tianhao Xie, Linlian Jiang, Xinxin Zuo, Yang Wang, Tiberiu Popa

机构 * Concordia University(康考迪亚大学) Mila–Quebec AI Institute(Mila-魁北克人工智能研究所)

AI总结 FACT-GS通过根据局部视觉频率分配纹理采样密度,提高2D高斯点划法的纹理空间利用效率,实现更清晰的高频细节表现。

Comments 11 pages, 6 figures, CVPR 2026 Findings track. Project page: https://tianhaoxie.github.io/project/FACT-GS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21331 2026-04-06 cs.CV cs.AI

The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment

更多更好:用于高阶多模态对齐的对比融合

Stefanos Koutoupis, Michaela Areti Zervou, Konstantinos Kontras, Maarten De Vos, Panagiotis Tsakalides, Grigorios Tsagkatakis

机构 * Foundation for Research and Technology-Hellas(希腊研究与技术基金会) University of Crete(克里特大学) KU Leuven(鲁汶大学)

AI总结 本文提出对比融合框架,通过联合嵌入个体模态及其融合组合,捕捉高阶依赖关系,提升多模态对齐效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17722 2026-04-06 cs.CV

Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions

视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析

Saurav Sengupta, Nazanin Moradinasab, Jiebei Liu, Donald E. Brown

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)

AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。

Comments Accepted at COGVL Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04728 2026-04-06 eess.IV cs.CV physics.ins-det

Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopy

基于神经场的多探测器信号扫描电子显微镜微结构三维表面重建

Shuo Chen, Yijin Li, Xi Zheng, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Alibaba Group(阿里巴巴集团) Analysis Center of Agriculture, Life and Environment Sciences, Zhejiang University(浙江大学农业、生命与环境科学分析中心)

AI总结 本文提出NFH-SEM框架,利用神经场整合多视图几何与探测器信号光度立体线索,实现高保真三维表面重建,展示了在不同材料上的精确恢复能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏