arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2512.05597 2026-04-01 cs.CV

Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Prediction

快速场景脚本:通过多令牌预测实现高效准确的语言基3D场景理解

Ruihong Yin, Xuepeng Shi, Oleksandr Bailo, Marco Manfredi, Theo Gevers

机构 * Qualcomm XR Labs(高通XR实验室) University of Amsterdam(阿姆斯特丹大学)

AI总结 本文提出Fast SceneScript,通过多令牌预测和自适应解码方法,在保持精度的同时提升3D场景理解的推理速度,实验表明其在合成和真实数据集上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22715 2026-04-01 cs.CV cs.AI cs.CL cs.MM

ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering

ReAG:基于推理的生成用于基于知识的视觉问答

Alberto Compagnoni, Marco Morini, Sara Sarto, Federico Cocchi, Davide Caffagni, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学) University of Pisa(比萨大学)

AI总结 ReAG通过结合粗粒度和细粒度检索及批评模型过滤无关信息,提升知识密集型视觉问答的准确性和可解释性。

Comments CVPR 2026 - Project page: https://aimagelab.github.io/ReAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00524 2026-04-01 cs.CV

Text-guided Fine-Grained Video Anomaly Understanding

基于文本引导的细粒度视频异常理解

Jihao Gu, Kun Li, He Wang, Kaan Akşit

机构 * University College London(伦敦大学学院) CVLab, College of Information Technology, United Arab Emirates University(阿联酋大学信息技术学院计算机视觉实验室)

AI总结 本文提出T-VAU框架,通过多模态推理提取细粒度视频异常证据,结合Anomaly Heatmap Decoder和Region-aware Anomaly Encoder提升异常检测与解释能力。

Comments Accepted by CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23043 2026-04-01 cs.CV

HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling

HieraMamba:通过分层锚点-Mamba池化实现视频时间接地

Joungbin An, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 HieraMamba通过分层锚点-Mamba池化结构,在长视频中实现精确的时间定位,解决了视频时间接地中的全局上下文与细粒度时间细节捕捉难题。

Comments CVPR 2026. Project Page: https://vision.cs.utexas.edu/projects/hieramamba/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10388 2026-04-01 cs.CV

VT-Intrinsic: Physics-Based Decomposition of Reflectance and Shading using a Single Visible-Thermal Image Pair

VT-Intrinsic: 基于物理的单可见-热图像对的反光与阴影分解

Zeqing Yuan, Mani Ramanagopal, Aswin C. Sankaranarayanan, Srinivasa G. Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种基于物理的单可见-热图像对的反光与阴影分解方法,通过利用热成像仪检测吸收的热量来关联可见和热图像的强度顺序,实现反光和阴影的自监督恢复。

Comments Accepted by CVPR 2026. Project webpage: https://vt-intrinsic.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12692 2026-04-01 cs.CV cs.AI cs.LG

Multi-Level Knowledge Distillation and Dynamic Self-Supervised Learning for Continual Learning

多级知识蒸馏与动态自监督学习用于持续学习

Taeheon Kim, San Kim, Minhyuk Seo, Dongjae Jeon, Wonje Jeung, Jonghyun Choi

机构 * Yonsei University(延世大学) Seoul National University(首尔大学)

AI总结 本文提出多级知识蒸馏和动态自监督学习,用于解决持续学习中的类别增量问题,通过利用未标记数据提升模型稳定性与可塑性,实验显示在CVPR CLVISION挑战中取得第二名。

Comments 2nd Place in Class-Incremental with Repetition (CIR) using Unlabeled Data Challenge at 5th CLVISION workshop, CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04466 2026-04-01 cs.CV

Emotional Speech-driven 3D Body Animation via Disentangled Latent Diffusion

基于解耦潜在扩散的情感语音驱动3D人体动画

Kiran Chhatre, Radek Daněček, Nikos Athanasiou, Giorgio Becherini, Christopher Peters, Michael J. Black, Timo Bolkart

机构 * KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院) Max Planck Institute for Intelligent Systems, Germany(德国马克斯·普朗克智能系统研究所)

AI总结 本文提出AMUSE模型,通过解耦潜在向量实现情感语音驱动的3D人体动画生成,能控制情绪和风格,生成更符合语音内容且表现更真实的情绪动作序列。

Comments Conference on Computer Vision and Pattern Recognition (CVPR) 2024. Webpage: https://amuse.is.tue.mpg.de/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28766 2026-03-31 cs.CV

HandX: Scaling Bimanual Motion and Interaction Generation

HandX:扩展双臂运动和交互生成

Zimu Zhang, Yucheng Zhang, Xiyan Xu, Ziyin Wang, Sirui Xu, Kai Zhou, Bing Zhou, Chuan Guo, Jian Wang, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Specs Inc.(Specs公司) Snap Inc.(Snap公司)

AI总结 本文提出HandX,通过整合数据、标注和评估,解决双臂运动生成中精细指节动态和协作的不足,验证了大模型在生成高质量双臂运动中的有效性。

Comments CVPR 2026. Project Page: https://handx-project.github.io. Code: https://github.com/handx-project/HandX

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28760 2026-03-31 cs.CV cs.RO

SHOW3D: Capturing Scenes of 3D Hands and Objects in the Wild

SHOW3D:捕捉真实环境中的3D手和物体场景

Patrick Rim, Kevin Harris, Braden Copple, Shangchen Han, Xu Xie, Ivan Shugurov, Sizhe An, He Wen, Alex Wong, Tomas Hodan, Kun He

机构 * Meta Reality Labs(Meta现实实验室) Yale University(耶鲁大学)

AI总结 本文提出SHOW3D数据集,通过多摄像头系统实现真实环境中手与物体交互的3D标注,解决了传统数据集环境单一的问题,提升了模型在现实场景中的泛化能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28757 2026-03-31 cs.CV cs.MM cs.SD

SonoWorld: From One Image to a 3D Audio-Visual Scene

SonoWorld:从一张图像到一个三维音频视觉场景

Derong Jin, Xiyi Chen, Ming C. Lin, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 本文提出Image2AVScene任务,通过SonoWorld框架生成三维音频视觉场景,结合图像生成全景、三维场景构建、语言引导声音锚点和空间音频渲染,实现沉浸式体验。

Comments Accepted by CVPR 2026, project page: https://humathe.github.io/sonoworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28718 2026-03-31 cs.LG cs.AI cs.CV

Stepwise Credit Assignment for GRPO on Flow-Matching Models

分步信用分配用于流匹配模型中的GRPO

Yash Savani, Branislav Kveton, Yuchen Liu, Yilin Wang, Jing Shi, Subhojyoti Mukherjee, Nikos Vlassis, Krishna Kumar Singh

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究院)

AI总结 本文提出分步流GRPO,通过分步奖励改进提升样本效率和收敛速度,引入DDIM启发的SDE提升奖励质量。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026 Project page: https://stepwiseflowgrpo.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24996 2026-03-31 cs.CR

IrisFP: Adversarial-Example-based Model Fingerprinting with Enhanced Uniqueness and Robustness

IrisFP:基于对抗示例的模型指纹识别方法,增强唯一性和鲁棒性

Ziye Geng, Guang Yang, Yihang Chen, Changqing Luo

AI总结 本文提出IrisFP,通过多边界特征、多样本行为和指纹判别力评估生成复合样本指纹,提升模型指纹的唯一性和鲁棒性,实验表明其优于现有方法。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14022 2026-03-31 cs.CV

A Hyperbolic Perspective on Hierarchical Structure in Object-Centric Scene Representations

从双曲视角看对象中心场景表示中的分层结构

Neelu Madan, Àlex Pujol, Andreas Møgelmose, Sergio Escalera, Kamal Nasrollahi, Graham W. Taylor, Thomas B. Moeslund

机构 * Aalborg University & Pioneer Centre for AI, Denmark(奥尔堡大学 & 人工智能先锋中心,丹麦) Universitat de Barcelona & Computer Vision Center, Spain(巴塞罗那大学 & 计算机视觉中心,西班牙) Milestone Systems, Denmark(Milestone Systems,丹麦) University of Guelph & Vector Institute, Canada(圭尔夫大学 & 向量研究所,加拿大)

AI总结 本文提出将欧几里得槽嵌入投影到双曲空间的简单流程,揭示双曲几何能揭示隐藏的分层结构,发现低曲率在父槽检索中表现优异,中等曲率提升跨层分离。

Comments accepted at CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11448 2026-03-31 cs.LG cs.CV

Hierarchical Concept Embedding & Pursuit for Interpretable Image Classification

层次化概念嵌入与追求用于可解释的图像分类

Nghia Nguyen, Tianjiao Ding, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出HCEP框架,通过在潜在空间中诱导概念嵌入的层次结构,利用层次稀疏编码恢复图像中的概念,提升分类可解释性与精度。

Comments To be published in Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15288 2026-03-31 cs.CV

APPLE: Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping

APPLE:基于扩散模型的属性保留伪标签面部交换

Jiwon Kang, Yeji Choi, JoungBin Lee, Wooseok Jang, Jinhyeok Choi, Taekeun Kang, Yongjae Park, Myungin Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) SAMSUNG(三星)

AI总结 本文提出APPLE框架,通过条件去模糊和属性感知反向方案提升面部交换中属性保留能力,实现高保真属性与身份转移。

Comments Accepted at CVPR 2026. Project Page: https://cvlab-kaist.github.io/APPLE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11404 2026-03-31 cs.RO

ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models

ACoT-VLA:面向视觉-语言-动作模型的行动链式推理

Linqing Zhong, Yi Liu, Yifei Wei, Ziyu Xiong, Maoqing Yao, Si Liu, Guanghui Ren

机构 * Beihang University(北京航空航天大学) AgiBot

AI总结 本文提出ACoT-VLA,通过在动作空间中直接进行推理,改进视觉-语言-动作模型的行动生成,引入显式和隐式动作推理器,实验证明其在真实和仿真环境中的优越性。

Comments Accepted by Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22442 2026-03-31 cs.PF cs.AI cs.CV cs.LG stat.ML

What Is the Optimal Ranking Score Between Precision and Recall? We Can Always Find It and It Is Rarely $F_1$

精确度与召回率之间最优的排名得分是什么?我们总能找到它,而且很少是F1

Sébastien Piérard, Adrien Deliège, Marc Van Droogenbroeck

机构 * Montefiore Institute, University of Liège(列日大学蒙特菲奥雷研究所)

AI总结 本文探讨了精确度与召回率的最优排名得分问题,提出通过Kendall排名相关性优化方法,理论工具和闭式表达式确定最优β值,展示了在六个案例研究中的应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05800 2026-03-31 cs.RO cs.CV

3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks

3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务

Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)

AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。

Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28605 2026-03-31 cs.CV cs.CY cs.LG

Unsafe2Safe: Controllable Image Anonymization for Downstream Utility

Unsafe2Safe: 可控图像匿名化以保障下游效用

Mih Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

AI总结 Unsafe2Safe通过多模态引导的扩散编辑实现图像隐私保护,减少敏感信息并保持下游任务性能。

Comments Accepted at CVPR 2026 and CVPR 2026 Workshop on Machine Unlearning for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28550 2026-03-31 cs.CV

MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures

MarkushGrapher-2:端到端多模态识别化学结构

Tim Strohmeyer, Lucas Morin, Gerhard Ingmar Meijer, Valéry Weber, Ahmed Nassar, Peter Staar

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出MarkushGrapher-2,通过OCR提取化学图像文本,结合视觉-文本-布局编码器和光学化学结构识别编码器,实现多模态化学结构识别,并通过两阶段训练策略提升性能,同时构建大规模真实世界Markush结构数据集。

Comments 15 pages, to be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28480 2026-03-31 cs.CV

INSID3: Training-Free In-Context Segmentation with DINOv3

INSID3: 无需训练的上下文分割

Claudia Cuttano, Gabriele Trivigno, Christoph Reich, Daniel Cremers, Carlo Masone, Stefan Roth

机构 * Politecnico di Torino(都灵理工大学) TU Darmstadt(达姆施塔特工业大学) TU Munich(慕尼黑工业大学) ELIZA MCML(慕尼黑机器学习中心)

AI总结 INSID3通过冻结DINOv3特征实现多粒度概念分割,无需监督或辅助模型,提升一shot分割性能,参数更少且mIoU提升7.5%。

Comments CVPR 2026. Project page: https://visinf.github.io/INSID3

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28405 2026-03-31 cs.CV cs.AI

EdgeDiT: Hardware-Aware Diffusion Transformers for Efficient On-Device Image Generation

EdgeDiT:面向边缘设备的高效扩散变换器

Sravanth Kodavanti, Manjunath Arveti, Sowmya Vajrala, Srinivas Miriyala, Vikram N R

机构 * Samsung Research Institute Bangalore, India(三星研究所班加罗尔)

AI总结 本文提出EdgeDiT,一种为移动端NPU优化的高效生成变换器,通过硬件感知优化减少参数和计算量,提升边缘设备图像生成效率。

Comments Accepted at the Mobile AI Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28224 2026-03-31 cs.CV

Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removal

Ghost-FWL: 一种大规模全波形激光雷达数据集用于鬼影检测与去除

Kazuma Ikeda, Ryosei Hara, Rokuto Nagata, Ozora Sako. Zihao Ding, Takahiro Kado, Ibuki Fujioka, Taro Beppu, Mariko Isogawa, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学) Sony Semiconductor Solutions(索尼半导体解决方案)

AI总结 本文提出Ghost-FWL数据集,用于解决移动激光雷达中鬼影点的检测与去除问题,通过全波形激光雷达数据提升3D映射和定位精度,实验表明其在SLAM和目标检测任务中效果显著。

Comments Accepted to CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28211 2026-03-31 cs.CV

Explaining CLIP Zero-shot Predictions Through Concepts

通过概念解释CLIP零样本预测

Onat Ozdemir, Anders Christensen, Stephan Alaniz, Zeynep Akata, Emre Akbas

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) Orbital DTU Compute, Technical University of Denmark(丹麦技术大学DTU计算学院) Dept. of Biology, University of Copenhagen(哥本哈根大学生物系) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工学院巴黎电信学院LTCI实验室) Technical University of Munich (TUM)(慕尼黑工业大学) Helmholtz Munich(亥姆霍兹慕尼黑中心) MCML MDSI Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)

AI总结 本文提出EZPC方法,通过人类可理解的概念解释CLIP的零样本预测,保持分类精度并提供概念层面的解释。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28182 2026-03-31 cs.CV

A Closer Look at Cross-Domain Few-Shot Object Detection: Fine-Tuning Matters and Parallel Decoder Helps

对跨域少样本目标检测的深入研究:微调至关重要,平行解码器有所帮助

Xuanlong Yu, Youyang Sha, Longfei Liu, Xi Shen, Di Yang

机构 * Intellindust AI Lab(Intellindust AI实验室) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院)

AI总结 本文提出混合集成解码器提升微调泛化能力,结合统一渐进微调框架和plateau-aware学习率调度,验证了在CD-FSOD、ODinW-13和RF100-VL数据集上的有效性,尤其在10-shot设置中优于SAM3。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28149 2026-03-31 cs.CV

BlankSkip: Early-exit Object Detection onboard Nano-drones

BlankSkip: Nano无人机上的早期退出目标检测

Carlo Marra, Beatrice Alessandra Motetti, Alessio Burrello, Enrico Macii, Massimo Poncino, Daniele Jahier Pagliari

机构 * Politecnico di Torino(都灵理工大学)

AI总结 本文提出BlankSkip,一种用于无人机目标检测的自适应网络,通过简单辅助分类任务实现早期退出,提升推理效率,实验显示在Nano无人机平台上实现24%的吞吐量提升,仅牺牲0.015mAP。

Comments Accepted for publication in the Embedded Vision Workshop of the 2026 Computer Vision and Pattern Recognition (CVPR) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28142 2026-03-31 cs.CV cs.AI

RecycleLoRA: Rank-Revealing QR-Based Dual-LoRA Subspace Adaptation for Domain Generalized Semantic Segmentation

RecycleLoRA: 基于秩揭示QR分解的双LoRA子空间适应用于领域泛化的语义分割

Chanseul Cho, Seokju Yun, Jeaseong Jeon, Seungjae Moon, Youngmin Ro

机构 * Machine Intelligence Laboratory, University of Seoul, Korea(韩国首尔大学机器智能实验室)

AI总结 RecycleLoRA通过秩揭示QR分解系统利用视觉基础模型的子空间结构,提升LoRA的表示丰富性,实现领域泛化语义分割的高性能表现。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28120 2026-03-31 cs.CV

MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding

MedLoc-R1: 为基于GRPO的医疗视觉接地任务的性能感知课程奖励调度

Guangjing Yang, Ziyuan Qin, Chaoran Zhang, Chenlin Du, Jinlin Wang, Wanran Sun, Zhenyu Zhang, Bing Ji, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Peking University(北京大学) Shandong University(山东大学)

AI总结 本文提出MedLoc-R1框架,通过性能感知奖励调度提升医疗视觉接地任务的定位准确性和训练稳定性,无需引入辅助网络。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏