arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-08 至 2026-04-08 共收录 30
2604.06129 2026-04-08 cs.CV cs.AI

PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer

PoM:一种线性时间的注意力替代方案:多项式混合器

David Picard, Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Davide Allegro, Tom Ravaud, Yohann Perron, Corentin Sautier, Zeynep Sonat Baltaci, Fei Meng, Syrine Kalleli, Marta López-Rauhut, Thibaut Loiseau, Ségolène Albouy, Raphael Baena, Elliot Vincent, Loic Landrieu

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM,法国国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎高科路桥学院,巴黎综合理工学院) LIX, École Polytechnique, CNRS, IP Paris(LIX,巴黎综合理工学院,法国国家科学研究中心,巴黎综合理工学院) Department of Information Engineering, Università degli Studi di Padova(帕多瓦大学信息工程系) AMIAD, Pole recherche, EFEO(AMIAD,法国远东学院研究部) LASTIG, Univ Gustave Eiffel, IGN, Géodata Paris(LASTIG,古斯塔夫·埃菲尔大学,法国国家地理与森林信息研究所,巴黎地理数据)

AI总结 本文提出PoM,一种线性复杂度的替代注意力机制,通过学习多项式函数聚合输入令牌,实现高效序列处理,减少长序列计算成本。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06099 2026-04-08 cs.CV

Extending ZACH-ViT to Robust Medical Imaging: Corruption and Adversarial Stress Testing in Low-Data Regimes

扩展ZACH-ViT以实现鲁棒医学影像:在低数据环境下对损坏和对抗性压力测试

Athanasios Angelakis, Marta Gomez-Barrero

机构 * BioML Lab, RI CODE, UniBw, Munich, Germany(慕尼黑联邦国防军大学,RI CODE,BioML实验室,德国慕尼黑) AUMC, Amsterdam, Netherlands(阿姆斯特丹大学医学中心,荷兰阿姆斯特丹)

AI总结 本文扩展ZACH-ViT,评估其在低数据环境下对常见图像损坏和对抗扰动的鲁棒性,发现其在清洁数据和常见损坏下表现优异,在对抗性压力下仍保持竞争力,但对抗鲁棒性仍是挑战。

Comments Accepted at CVPR 2026 Workshop (PHAROS-AIF-MIH)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22844 2026-04-08 cs.AI

PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal

PhySe-RPO:物理与语义引导的相对策略优化用于基于扩散的手术烟雾去除

Zining Fang, Cheng Xue, Chunhui Liu, Bin Xu, Ming Chen, Xiaowei Hu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

AI总结 本文提出PhySe-RPO框架,通过物理和语义引导的相对策略优化,解决手术烟雾去除中配对监督不足的问题,实现物理一致、语义忠实且临床可解释的扩散修复。

Comments 12 pages,7figures,published to CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18601 2026-04-08 cs.GR cs.AI cs.CV cs.LG

BulletGen: Improving 4D Reconstruction with Bullet-Time Generation

BulletGen: 通过子弹时间生成提升4D重建

Denis Rozumny, Jonathon Luiten, Numair Khan, Johannes Schönberger, Peter Kontschieder

机构 * Meta Reality Labs(Meta 现实实验室)

AI总结 BulletGen利用生成模型在Gaussian动态场景表示中校正错误并补全缺失信息,通过对扩散视频生成模型输出与4D重建在单个冻结子弹时间步骤的对齐,实现新颖视角合成和2D/3D跟踪任务的最先进结果。

Comments Accepted at CVPR 2026 Workshop "4D World Models: Bridging Generation and Reconstruction"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05780 2026-04-08 cs.CV

Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion

稀疏感知体素注意力与前景调节用于3D语义场景补全

Yu Xue, Longjun Gao, Yuanqi Su, HaoAng Lu, Xiaoning Zhang

AI总结 本文提出VoxSAMNet,通过稀疏感知和语义引导设计,解决单目语义场景补全中体素分布不平衡和泛化能力差的问题,实现更高效准确的3D场景补全。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05748 2026-04-08 cs.CV

SVC 2026: the Second Multimodal Deception Detection Challenge and the First Domain Generalized Remote Physiological Measurement Challenge

SVC 2026: 第二届多模态欺骗检测挑战赛及首个领域通用远程生理测量挑战

Dongliang Zhu, Zhiyi Niu, Bo Zhao, Jiajian Huang, Shuo Ye, Xun Lin, Hui Ma, Taorui Wang, Jiayu Zhang, Chunmei Zhu, Junzhe Cao, Yingjie Ma, Rencheng Song, Albert Clapés, Sergio Escalera, Dan Guo, Zitong Yu

机构 * Wuhan University(武汉大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Hefei University of Technology(合肥工业大学) University of Barcelona(巴塞罗那大学)

AI总结 本文提出SVC 2026挑战赛,旨在通过多模态欺骗检测和远程脉搏波测速估计任务,推动对细微视觉信号的鲁棒表示学习研究。

Comments Accepted by the SVC workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05730 2026-04-08 cs.LG

Controllable Image Generation with Composed Parallel Token Prediction

通过组合并行令牌预测实现可控图像生成

Jamie Stirling, Noura Al-Moubayed, Chris G. Willcocks, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,相比现有方法在误差率和FID上均有显著提升,并实现高效的文本到图像生成控制。

Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF). arXiv admin note: substantial text overlap with arXiv:2405.06535

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05724 2026-04-08 cs.CV

Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP

超越语义:在稀疏自编码器中解构信息范围以用于CLIP

Yusung Ro, Jaehyun Choi, Junmo Kim

机构 * KAIST(韩国科学技术院) Korea AI Safety Institute, ETRI(韩国电子通信研究院人工智能安全研究所)

AI总结 本文提出信息范围作为理解CLIP表示的新维度,通过Contextual Dependency Score量化稀疏自编码器特征的广度,揭示不同信息范围特征对CLIP预测和置信度的影响差异。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05721 2026-04-08 cs.CV

GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidance

GaussianGrow:基于3D点云与文本引导的几何感知Gaussian生成

Weiqi Zhang, Junsheng Zhou, Haotian Geng, Kanle Shi, Shenkun Xu, Yi Fang, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Kuaishou Technology(快手科技) CAIR and CIDSAI, NYU Abu Dhabi(纽约大学阿布扎比分校CAIR和CIDSAI)

AI总结 本文提出GaussianGrow,通过学习从3D点云中生长Gaussian,结合多视角扩散模型和文本引导,提升生成几何精度与质量。

Comments Accepted by CVPR 2026. Project page: https://weiqi-zhang.github.io/GaussianGrow

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05715 2026-04-08 cs.CV

In Depth We Trust: Reliable Monocular Depth Supervision for Gaussian Splatting

深入信赖:为高斯散射可靠的单目深度监督

Wenhui Xiao, Ethan Goan, Rodrigo Santa Cruz, David Ahmedt-Aristizabal, Olivier Salvado, Clinton Fookes, Leo Lebrat

机构 * Queensland University of Technology(昆士兰科技大学)

AI总结 本文提出一种整合模糊和噪声深度先验的训练框架,以提升高斯散射的几何监督,从而提高渲染质量。

Comments accepted to CVPR 3DMV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05524 2026-04-08 cs.CV

Cross-Resolution Diffusion Models via Network Pruning

通过网络剪枝实现跨分辨率扩散模型

Jiaxuan Ren, Junhan Zhu, Huan Wang

机构 * Westlake University(西湖大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出CR-Diff方法,通过参数剪枝提升扩散模型在不同分辨率下的视觉一致性,保持默认分辨率性能,支持提示特定优化。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05497 2026-04-08 cs.AI cs.CV

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

Thinking Diffusion: 通过惩罚和引导在扩散多模态语言模型中抑制和引导视觉推理

Keuntae Kim, Mingyu Kang, Yong Suk Choi

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系)

AI总结 本文针对扩散多模态语言模型在视觉推理中生成过早答案的问题,提出位置与步数惩罚和视觉推理引导方法,提升推理准确率并加快推理速度。

Comments CVPR 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05436 2026-04-08 cs.CV cs.AI

Human Interaction-Aware 3D Reconstruction from a Single Image

面向人类交互的单图像三维重建

Gwanghyun Kim, Junghun James Kim, Suh Yoon Jeon, Jason Park, Se Young Chun

机构 * Seoul National University(首尔大学)

AI总结 本文提出HUG3D框架,通过建模群体和实例级信息,解决多人类场景中的几何失真和交互问题,实现高保真三维重建。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05393 2026-04-08 cs.CV cs.MM

Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval

超越语义检索:面向组合图像检索的指代锚定

Yuxin Yang, Yinan Zhou, Yuxin Chen, Ziqi Zhang, Zongyang Ma, Chunfeng Yuan, Bing Li, Jun Gao, Weiming Hu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Inc.(腾讯公司) PeopleAI Inc.(人民人工智能公司) HelloGroup Inc.(哈啰集团) ShanghaiTech University(上海科技大学)

AI总结 本文提出OACIR任务,通过引入对象锚定机制提升组合图像检索的实例一致性,构建了包含16万多个四元组的OACIRR基准,采用AdaFocal框架实现动态关注平衡,实验表明其在保持实例一致性方面表现优异。

Comments Accepted to CVPR 2026. Project page, dataset, and code are available at: https://hahajun1101.github.io/OACIR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05316 2026-04-08 cs.CV

Indoor Asset Detection in Large Scale 360° Drone-Captured Imagery via 3D Gaussian Splatting

通过3D高斯散射实现大规模360°无人机拍摄影像中的室内资产检测

Monica Tang, Avideh Zakhor

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文提出一种基于3D高斯散射的室内资产检测方法,通过结合掩码语义和空间信息,提升多视角掩码关联和检测精度,实验显示在两个大型室内场景中,F1分数提升65%,mAP提升11%。

Comments Accepted to CVPR 2026 3DMV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05171 2026-04-08 cs.CV cs.AI

Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI

多模态脑MRI的模态感知与解剖矢量量化自编码

Mingjie Li, Edward Kim, Yue Zhao, Ehsan Adeli, Kilian M. Pohl

机构 * Stanford University(斯坦福大学)

AI总结 本文提出NeuroQuant,一种基于模态感知和解剖学的3D矢量量化自编码器,用于多模态脑MRI重建,通过共享潜在表示和双流编码提升重建精度。

Comments CVPR Fingdings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04576 2026-04-08 cs.CV

PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis

PR-IQA:基于扩散模型的新型视角合成的部分参考图像质量评估

Inseong Choi, Siwoo Lee, Seung-Hun Nam, Soohwan Song

机构 * Dongguk University(东国大学) NAVER WEBTOON AI

AI总结 PR-IQA通过部分参考图像评估扩散生成的视角合成图像质量,提升3D重建效果,无需真实地面真值。

Comments Accepted at CVPR 2026. Project Page: https://kakaomacao.github.io/pr-iqa-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00503 2026-04-08 cs.CV

PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training

PET-DINO:将视觉线索统一到Grounding DINO中通过提示增强训练

Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang

机构 * YouTu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技可灵团队)

AI总结 PET-DINO通过提示增强训练策略,统一视觉线索到Grounding DINO中,提升零样本目标检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26481 2026-04-08 cs.CV

SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras

SparseCam4D:从稀疏摄像机进行时空一致的4D重建

Weihong Pan, Xiaoyu Zhang, Zhuang Zhang, Zhichao Ye, Nan Wang, Haomin Liu, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) InSpatio Research

AI总结 本文提出一种基于稀疏摄像机的动态重建框架,通过建模生成观测中的时空不一致性和开发完整流程,实现高保真4D重建并显著优于现有方法。

Comments CVPR 2026. Project page: https://inspatio.github.io/sparse-cam4d/ and code: https://github.com/inspatio/sparse-cam4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11680 2026-04-08 cs.CV

UCAN: Unified Convolutional Attention Network for Expansive Receptive Fields in Lightweight Super-Resolution

UCAN:统一的卷积注意力网络用于轻量超分辨率中的扩展感受野

Cao Thien Tan, Phan Thi Thu Trang, Do Nghiem Duc, Ho Ngoc Anh, Hanyang Zhuang, Nguyen Duc Dung

机构 * Ho Chi Minh City Open University(胡志明市开放大学) AI Tech Lab, Ho Chi Minh City University of Technology(胡志明市科技大学人工智能技术实验室) Code Mely AI Research Team(Code Mely 人工智能研究团队) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Ha Noi University of Science and Technology(河内科技大学) University of Manitoba(曼尼托巴大学)

AI总结 UCAN通过融合卷积与注意力机制,有效扩展感受野,采用Hedgehog注意力和蒸馏模块实现高效轻量化,适用于资源受限设备的超分辨率恢复。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10649 2026-04-08 cs.CV

MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning

MINERVA-Cultural: 一个用于文化和多语言长视频推理的基准

Darshan Singh, Arsha Nagrani, Kawshik Manikantan, Harman Singh, Dinesh Tewari, Tobias Weyand, Cordelia Schmid, Anelia Angelova, Shachi Dave

机构 * Google DeepMind(谷歌DeepMind) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出MINERVA-Cultural基准,旨在解决现有视频评估中文化偏见问题,通过多语言多文化视频数据和原生语言问题,推动视频推理模型的发展。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06928 2026-04-08 cs.CV

RenderFlow: Single-Step Neural Rendering via Flow Matching

RenderFlow:通过流匹配实现单步神经渲染

Shenghao Zhang, Runtao Liu, Christopher Schroers, Yang Zhang

机构 * Disney Research|Studios(迪士尼研究院/工作室) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出RenderFlow框架,通过流匹配方法实现单步神经渲染,解决传统渲染方法的效率与精度问题,提升渲染质量和视觉效果。

Comments CVPR 2026; Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13592 2026-04-08 cs.LG cs.CV

Image Diffusion Preview with Consistency Solver

图像扩散预览与一致性求解器

Fu-Yun Wang, Hao Zhou, Liangzhe Yuan, Sanghyun Woo, Boqing Gong, Bohyung Han, Ming-Hsuan Yang, Han Zhang, Yukun Zhu, Ting Liu, Long Zhao

机构 * Google DeepMind(谷歌DeepMind) The Chinese University of Hong Kong(香港中文大学) Seoul National University(首尔大学)

AI总结 本文提出ConsistencySolver,通过强化学习优化的轻量高阶求解器,提升图像扩散预览的质量与一致性,减少推理步骤,提高交互效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18359 2026-04-08 cs.CV

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds

TRANSPORTER:从VLM流形转移视觉语义

Alexandros Stergiou

机构 * University of Twente, NL(荷兰特温特大学)

AI总结 本文提出TRANSPORTER方法,通过logits-to-video任务生成视频,揭示VLM预测背后的规则,为模型可解释性提供新方向。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10610 2026-04-08 cs.CR cs.AI

LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

LaSM:用于防御GUI代理中弹出攻击的分层缩放机制

Zihe Yan, Jiaping Gui, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出LaSM机制,通过分层放大关键层的注意力和MLP模块,提升模型对任务相关区域的对齐性,有效防御弹出攻击,同时不影响模型整体能力。

Comments Accepted by CVPR-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22397 2026-04-08 eess.IV cs.AI cs.CV

HazeMatching: Dehazing Light Microscopy Images with Guided Conditional Flow Matching

HazeMatching:利用引导条件流匹配去雾光学显微镜图像

Anirban Ray, Ashesh Ashesh, Florian Jug

机构 * Human Technopole(人类技术中心) Technische Universität Dresden(德累斯顿工业大学)

AI总结 本文提出HazeMatching方法,通过引导条件流匹配框架平衡去雾图像的保真度与真实感,利用模糊观测引导生成过程,有效解决显微图像去雾中的保真与真实感平衡问题。

Comments Accepted to IEEE/CVF CVPR 2026 (Findings). 4 figures, 8 pages + refs, 45 pages total (including supplement), 28 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00727 2026-04-08 cs.LG cs.CR cs.CV

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

扰动与恢复:用于从CLIP中有效移除后门的微调

Naman Deep Singh, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) EPFL(瑞士联邦理工学院洛桑)

AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05366 2026-04-08 cs.CV

The DeepSpeak Dataset

DeepSpeak 数据集

Sarah Barrington, Maty Bohacek, Hany Farid

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 本文提出DeepSpeak数据集,包含超过100小时的真实和深度伪造音频视频内容,旨在解决复杂的说话人头像场景。通过提供高质量的真实数据和生成的深度伪造数据,以及基于嵌入的身份匹配方法,提升深度伪造检测的鲁棒性。

Comments https://github.com/hfaridlab/deepspeak

Journal ref Published in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06535 2026-04-08 cs.CV cs.LG

Controllable Image Generation with Composed Parallel Token Prediction

通过组合并行令牌预测实现可控图像生成

Jamie Stirling, Noura Al-Moubayed, Chris G. Willcocks, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,提升图像生成的可控性和效率。

Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF)

详情

展开后加载摘要…

URL PDF HTML 收藏