arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2508.11538 2026-03-05 cs.CV

Reinforcing Video Reasoning Segmentation to Think Before It Segments

强化视频推理分割以在分割前思考

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu

AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。

Comments 12 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08492 2026-03-05 cs.CV

D2Dewarp: Dual Dimensions Geometric Representation Learning Based Document Image Dewarping

D2Dewarp: 基于双维度几何表示学习的文档图像去畸变

Heng Li, Xiangping Wu, Qingcai Chen

机构 * Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) PengCheng Laboratory(鹏城实验室)

AI总结 D2Dewarp通过双维度几何表示学习提升文档图像去畸变效果,提出细粒度变形感知模型和自动标注方法,构建新数据集并验证方法有效性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07510 2026-03-05 cs.CV quant-ph

Schrödinger's Camera: First Steps Towards a Quantum-Based Privacy Preserving Camera

薛定谔的相机:迈向基于量子的隐私保护相机的第一步

Hannah Kirkland, Sanjeev J. Koppal

AI总结 本文提出了一种基于量子态的隐私保护图像存储方法,并利用双深度Q学习算法实现对图像匿名化的控制,展示了在量子基础上平衡隐私与效用的可行性。

Journal ref 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 18-27

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03564 2026-03-05 cs.CV

Modeling Cross-vision Synergy for Unified Large Vision Model

跨视觉协同的统一大视觉模型建模

Shengqiong Wu, Lanhu Wu, Mingyang Bao, Wenhao Xu, Hanwang Zhang, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 PolyV通过统一架构和协同训练方法,实现了跨视觉模态的协同推理,显著提升了多模态视觉任务的性能。

Comments 21 pages, 9 figures, 16 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03265 2026-03-04 cs.CV

DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction

DuoMo:用于世界空间人体重建的双动差分

Yufu Wang, Evonne Ng, Soyong Shin, Rawal Khirodkar, Yuan Dong, Zhaoen Su, Jinhyung Park, Kris Kitani, Alexander Richard, Fabian Prada, Michael Zollhofer

机构 * Meta Reality Labs University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 DuoMo通过双扩散模型实现世界空间人体运动重建,有效处理噪声和不完整输入,提升重建精度。

Comments CVPR 2026. Project page: https://yufu-wang.github.io/duomo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02802 2026-03-04 cs.CV

NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

NOVA:无配对视频编辑的稀疏控制与密集合成

Tianlin Pan, Jiayi Dai, Chenpu Yuan, Zhengyao Lv, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Caifeng Shan, Chenyang Si

机构 * Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) WeChat, Tencent(微信、腾讯) The University of Hong Kong(香港大学)

AI总结 NOVA提出了一种无配对视频编辑框架,通过稀疏控制与密集合成提升编辑保真度和时间一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02785 2026-03-04 cs.CV

HiLoRA: Hierarchical Low-Rank Adaptation for Personalized Federated Learning

HiLoRA: 分层低秩适应用于个性化联邦学习

Zihao Peng, Nan Zou, Jiandian Zeng, Guo Li, Ke Chen, Boyuan Li, Tian Wang

机构 * Beijing Normal University(北京师范大学) Zhengzhou University(郑州大学)

AI总结 HiLoRA通过分层低秩适应框架,解决联邦学习中客户端结构忽视问题,提升个性化和泛化性能。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02134 2026-03-04 cs.CV

OnlineX: Unified Online 3D Reconstruction and Understanding with Active-to-Stable State Evolution

OnlineX: 一种基于主动到稳定状态演化的统一在线3D重建与理解方法

Chong Xia, Fangfu Liu, Yule Wang, Yize Pang, Yueqi Duan

机构 * Tsinghua University(清华大学)

AI总结 OnlineX通过解耦主动到稳定状态演化范式,实现基于流式图像的统一在线3D重建与理解,提升重建质量和实时推理效率。

Comments Accepted by CVPR Finding 2026 (Project page: https://xiac20.github.io/OnlineX/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02133 2026-03-04 cs.CV

SimRecon: SimReady Compositional Scene Reconstruction from Real Videos

SimRecon: 从真实视频中实现模拟准备的组合场景重建

Chong Xia, Kai Zhu, Zizhuo Wang, Fangfu Liu, Zhizheng Zhang, Yueqi Duan

机构 * Tsinghua University(清华大学) Galbot Project(Galbot项目)

AI总结 SimRecon通过引入主动视角优化和场景图合成器,解决了从真实视频中重建复杂场景时的视觉和物理真实性问题,实现了感知-生成-模拟的全流程流水线。

Comments Accepted by CVPR 2026 (Project page: https://xiac20.github.io/SimRecon/ )

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02099 2026-03-04 cs.CL

Recursive Think-Answer Process for LLMs and VLMs

递归思考-回答过程用于LLMs和VLMs

Byung-Kwan Lee, Youngchae Chee, Yong Man Ro

AI总结 本文提出递归思考-回答过程(R-TAP)以提升LLMs和VLMs的推理准确性,通过置信度生成器和双奖励机制实现迭代推理,减少错误输出并提高推理稳定性。

Comments CVPR 2026 Findings, Project page: https://litcoderr.github.io/rtap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00906 2026-03-04 cs.CV

ShiftLUT: Spatial Shift Enhanced Look-Up Tables for Efficient Image Restoration

ShiftLUT: 基于空间位移增强的查找表用于高效的图像修复

Xiaolong Zeng, Yitong Yu, Shiyao Xiong, Jinhua Hao, Ming Sun, Chao Zhou, Bin Wang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 ShiftLUT通过引入可学习空间位移模块和不对称双分支架构,实现了更大的感受野和更高的修复效率,同时保持低存储和计算开销。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10190 2026-03-04 cs.CV

Differentially Private 2D Human Pose Estimation

差分隐私的2D人体姿态估计

Kaushik Bhargav Sivangi, Paul Henderson, Fani Deligianni

机构 * School of Computing Science, University of Glasgow(计算机科学学院,格拉斯哥大学)

AI总结 本文提出了一种结合投影DP-SGD和特征差分隐私的混合框架,实现差分隐私下的2D人体姿态估计,有效平衡隐私与性能。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02411 2026-03-04 cs.CV cs.AI cs.LG

From Fewer Samples to Fewer Bits: Reframing Dataset Distillation as Joint Optimization of Precision and Compactness

从更少样本到更少位数:将数据集蒸馏重新框架化为精度和紧凑性的联合优化

My H. Dinh, Aditya Sant, Akshay Malhotra, Keya Patani, Shahab Hamidi-Rad

机构 * InterDigital Communications, Inc.(InterDigital通讯公司)

AI总结 QuADD通过联合优化数据集紧凑性和精度,在固定位预算下提升数据集蒸馏的效率和性能。

Comments Accepted to CVPR 2026 - Findings Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02390 2026-03-04 cs.CV eess.SP

OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environments

OpenMarcie:工业环境中的多模态动作识别数据集

Hymalai Bello, Lala Ray, Joanna Sorysz, Sungho Suh, Paul Lukowicz

机构 * DFKI Kaiserslautern(DFKI凯撒斯劳滕) RPTU Kaiserslautern-Landau(RPTU凯撒斯劳滕-兰道) Korea University(韩国大学)

AI总结 OpenMarcie是首个大规模多模态数据集,用于工业环境中的动作识别,包含36名参与者在不同任务中的多模态数据,支持活动分类、开放词汇描述和跨模态对齐任务。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02363 2026-03-04 cs.CV

Beyond Caption-Based Queries for Video Moment Retrieval

超越基于描述的查询的视频时刻检索

David Pujol-Perich, Albert Clapés, Dima Damen, Sergio Escalera, Michael Wray

机构 * University of Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) University of Bristol(布里斯托大学)

AI总结 本文提出了一种改进视频时刻检索方法,通过解决语言和多时刻查询的泛化问题,提升了搜索查询的性能。

Comments CVPR 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02329 2026-03-04 cs.CV

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

HAMMER: 通过跨模态整合利用大语言模型进行意图驱动的3D affordance grounding

Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 HAMMER通过跨模态整合多模态大语言模型,实现意图驱动的3D affordance grounding,提升3D表示的准确性和鲁棒性。

Comments Accepted by CVPR 2026. Project Page: https://rayyoh.github.io/Hammer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02286 2026-03-04 cs.CV cs.AI

Beyond Prompt Degradation: Prototype-guided Dual-pool Prompting for Incremental Object Detection

超越提示退化:基于原型的双池提示法用于增量物体检测

Yaoteng Zhang, Zhou Qing, Junyu Gao, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

AI总结 PDP提出双池提示解耦框架,通过分离任务通用和特定提示以缓解提示退化,提升增量物体检测的性能和稳定性。

Comments Our paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02280 2026-03-04 cs.LG cs.AI

Temporal Imbalance of Positive and Negative Supervision in Class-Incremental Learning

类增量学习中正负监督的时间不平衡

Jinge Ma, Fengqing Zhu

机构 * Purdue University(普渡大学)

AI总结 本文提出时间调整损失(TAL)以解决类增量学习中正负监督的时间不平衡问题,通过动态加权负监督减少灾难性遗忘并提升性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01650 2026-03-04 cs.CV

PromptStereo: Zero-Shot Stereo Matching via Structure and Motion Prompts

PromptStereo: 通过结构和运动提示实现零样本立体匹配

Xianqi Wang, Hao Yang, Hangtian Wang, Junda Cheng, Gangwei Xu, Min Lin, Xin Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Optics Valley Laboratory(光谷实验室)

AI总结 PromptStereo通过结构和运动提示提升零样本立体匹配的泛化性能,提出PRU模块增强单目深度模型的潜在表示。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01398 2026-03-04 cs.CV

Continuous Exposure-Time Modeling for Realistic Atmospheric Turbulence Synthesis

连续曝光时间建模用于真实大气湍流合成

Junwei Zeng, Dong Liang, Sheng-Jun Huang, Kun Zhan, Songcan Chen

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)

AI总结 本文提出ET-MTF模型,通过连续曝光时间建模生成真实大气湍流数据集,提升图像恢复和泛化能力。

Comments Accepted to CVPR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23334 2026-03-04 cs.CV

Markovian Scale Prediction: A New Era of Visual Autoregressive Generation

马尔可夫尺度预测:视觉自回归生成的新时代

Yu Zhang, Jingyi Liu, Yiwei Shi, Qi Zhang, Duoqian Miao, Changwei Wang, Longbing Cao

机构 * Tongji University(同济大学) University of Bristol(布里斯托大学) Macquarie University(麦考瑞大学)

AI总结 马尔可夫-VAR通过非全上下文马尔可夫过程提升视觉自回归生成的效率与效果

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03101 2026-03-04 cs.LG

AdaBet: Gradient-free Layer Selection for Efficient Training of Deep Neural Networks

AdaBet: 无梯度层选择用于深度神经网络高效训练

Irene Tenison, Soumyajit Chatterjee, Fahim Kawsar, Mohammad Malekzadeh

机构 * MIT(麻省理工学院) Nokia Bell Labs(诺基亚贝尔实验室) University of Glasgow(格拉斯哥大学)

AI总结 AdaBet通过无梯度方法选择重要层,提升深度神经网络在边缘设备上的训练效率和准确率。

Comments Full Version accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22499 2026-03-04 cs.CV

SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectors

SABER: 用于鸟瞰检测器的时空一致的3D通用对抗对象

Aixuan Li, Mochu Xiang, Bosen Hou, Zhexiong Wan, Jing Zhang, Yuchao Dai

机构 * School of Electronics and Information, Northwestern Polytechnical University & Shaanxi Key Laboratory of Information Acquisition and Processing, Xi’an, China(电子工程学院,西北工业大学 & 陕西省信息采集与处理重点实验室,西安,中国) School of Computing, Australian National University(计算学院,澳大利亚国立大学)

AI总结 SABER提出了一种生成通用、非侵入式且3D一致的对抗对象的方法,以揭示BEV 3D目标检测器的漏洞,并提供评估自动驾驶系统鲁棒性的实用流程。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02200 2026-03-03 cs.CV cs.AI cs.LG

Adaptive Confidence Regularization for Multimodal Failure Detection

多模态故障检测的自适应置信度正则化

Moru Liu, Hao Dong, Olga Fink, Mario Trapp

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院) Fraunhofer IKS(弗劳恩霍夫研究所)

AI总结 本文提出自适应置信度正则化方法,通过检测多模态预测中的置信度退化,提升故障识别的可靠性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02139 2026-03-03 cs.RO cs.CV

Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulation

重新思考相机选择:关于机器人操作中鱼眼相机属性的实证研究

Han Xue, Nan Min, Xiaotong Liu, Wendi Chen, Yuan Fang, Jun Lv, Cewu Lu, Chuan Wen

AI总结 本文通过实证研究发现鱼眼相机在机器人操作中需考虑视场角、环境复杂性和随机尺度增强策略以提升性能。

Comments 22 pages, 15 figures, Accecpted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02138 2026-03-03 cs.CV

OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens

OmniLottie:通过参数化Lottie令牌生成向量动画

Yiying Yang, Wei Cheng, Sijin Chen, Honghao Fu, Xianfang Zeng, Yujun Cai, Gang Yu, Xingjun Ma

AI总结 OmniLottie通过参数化Lottie令牌生成高质量向量动画,结合多模态指令与大规模数据集提升动画生成能力。

Comments Accepted by CVPR 2026. Project Page: https://openvglab.github.io/OmniLottie/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02096 2026-03-03 cs.CV cs.AI

FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding

FluxMem: 用于流视频理解的自适应分层内存

Yiweng Xie, Bo He, Junke Wang, Xiangyu Zheng, Ziyi Ye, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究所) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) University of Maryland, College Park(马里兰大学 College Park 分校)

AI总结 FluxMem通过自适应分层内存压缩技术,在流视频理解中实现了高效处理,提升了实时性能和离线表现。

Comments Accepted at CVPR 2026. Project page: https://yiwengxie.com/FluxMem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23697 2026-03-03 cs.CV

Towards Source-Aware Object Swapping with Initial Noise Perturbation

面向源感知的对象交换的初始噪声扰动

Jiahui Zhan, Xianbing Sun, Xiangnan Zhu, Yikun Ji, Ruitong Liu, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 SourceSwap通过初始噪声扰动实现自监督对象交换,无需额外数据即可实现高质量跨对象对齐和零样本推理。

Comments This paper is accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20160 2026-03-03 cs.CV

tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction

tttLRM:面向长上下文和自回归3D重建的测试时间训练

Chen Wang, Hao Tan, Wang Yifan, Zhiqin Chen, Yuheng Liu, Kalyan Sunkavalli, Sai Bi, Lingjie Liu, Yiwei Hu

机构 * University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe 研究) UCI(加州大学欧文分校)

AI总结 tttLRM通过测试时间训练实现长上下文自回归3D重建,提升重建质量和收敛速度。

Comments Accepted by CVPR 2026. Project Page: https://cwchenwang.github.io/tttLRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19096 2026-03-03 cs.LG

The Power of Decaying Steps: Enhancing Attack Stability and Transferability for Sign-based Optimizers

衰减步骤的力量:提升基于符号的优化器的攻击稳定性和可迁移性

Wei Tao, Yang Dai, Jincai Huang, Qing Tao

AI总结 本文提出MDCS方法,通过衰减步长提升基于符号优化器的攻击稳定性和可迁移性,理论证明其收敛率最优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏