arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2602.23040 2026-03-10 cs.CV

PackUV: Packed Gaussian UV Maps for 4D Volumetric Video

PackUV: 压缩高斯UV映射用于4D体素视频

Aashish Rai, Angela Xing, Anushka Agarwal, Xiaoyan Cong, Zekun Li, Tao Lu, Aayush Prakash, Srinath Sridhar

机构 * Brown University(布朗大学) UMass Amherst(马萨诸塞大学阿默斯特分校) Meta

AI总结 PackUV通过压缩高斯UV映射实现4D体素视频的高效存储与流式传输,解决了传统方法在长序列和大运动下的时间一致性问题。

Comments https://ivl.cs.brown.edu/packuv

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17908 2026-03-10 cs.CV cs.AI cs.LG

ReDepth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting

ReDepth Anything: 通过自监督重照明进行测试时深度细化

Ananta R. Bhattarai, Helge Rhodin

机构 * Bielefeld University(比勒菲尔德大学)

AI总结 ReDepth Anything通过自监督重照明技术,在测试时提升深度估计的准确性和真实感,优于现有方法并达到最新水平。

Comments Accepted at CVPR 2026 (Findings). Project Page: https://anantarb.github.io/redepth Code: https://github.com/anantarb/Re-Depth-Anything

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18734 2026-03-10 cs.CV cs.AI

Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion

Yo'City:通过自批评扩展实现个性化和无边界的3D逼真城市场景生成

Keyang Lu, Sifan Zhou, Hongbin Xu, Gang Xu, Zhifei Yang, Yikai Wang, Zhen Xiao, Jieyi Long, Ming Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beihang University(北航) Southeast University(东南大学) ByteDance Seed(字节跳动种子) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) Beijing Normal University(北京师范大学) Theta Labs(Theta实验室)

AI总结 Yo'City通过自批评扩展实现个性化和无边界的3D城市生成,利用大模型的推理能力提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18570 2026-03-10 cs.LG

VISTA: Vision-Language Inference for Training-Free Stock Time-Series Analysis

VISTA:面向无训练股票时间序列分析的视觉-语言推理

Tina Khezresmaeilzadeh, Parsa Razmara, Seyedarmin Azizi, Mohammad Erfan Sadeghi, Erfan Baghaei Potraghloo

机构 * University of Southern California(南加州大学)

AI总结 VISTA通过结合文本和视觉信息,利用无训练的视觉-语言模型实现股票时间序列预测,实验结果显示其在预测精度上显著优于传统方法。

Comments Accepted to the CVPR 2025 Workshop on Transformers for Vision (T4V): accepted-papers" target="_blank" rel="noopener">https://sites.google.com/view/t4v-cvpr25/accepted-papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17788 2026-03-10 cs.CV cs.AI

From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstruction

从二维对齐到三维合理性:统一异构二维先验和无穿透扩散以实现抗遮挡的双手重建

Gaoge Han, Yongkang Cheng, Zhe Chen, Shaoli Huang, Tongliang Liu

机构 * AgiBot Mohamed bin Zayed University of Artificial Intelligence The University of Sydney La Trobe University

AI总结 本文提出统一异构二维先验和无穿透扩散模型,以实现抗遮挡的双手重建,提升交互对齐和穿透抑制性能。

Comments Accepted by CVPR 2026 Main, Project: https://gaogehan.github.io/A2P/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06408 2026-03-09 cs.CV cs.AI cs.GR

Physical Simulator In-the-Loop Video Generation

物理模拟器闭环视频生成

Lin Geng Foo, Mark He Huang, Alexandros Lattas, Stylianos Moschoglou, Thabo Beeler, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Singapore University of Technology and Design(新加坡科技设计大学) A*STAR(新加坡科技研究局) Google(谷歌) Saarbrücken Research Center for Visual Computing, Interaction and Artificial Intelligence(斯图加特视觉计算、交互与人工智能研究中心)

AI总结 PSIVG通过整合物理模拟器与扩散模型,生成符合物理规律的视频,提升生成视频的真实性和一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06366 2026-03-09 cs.CV

OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析

Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang

机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) School of Computer Science, Peking University(北京大学计算机学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。

Comments 34 pages, 24 figures, conference

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06213 2026-03-09 cs.CV cs.AI

Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events

直击核心:一种无需训练的多模态摘要方法 via 事件链

Xiaoxing You, Qiang Huang, Lingyu Li, Xiaojun Chang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

AI总结 无需训练的多模态摘要方法CoE通过事件链和层次事件图实现跨模态整合与时间推理,提升摘要质量与领域适应性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06120 2026-03-09 cs.LG

Dynamic Momentum Recalibration in Online Gradient Learning

在线梯度学习中的动态动量重校准

Zhipeng Yao, Rui Yu, Guisong Chang, Ying Li, Yu Zhang, Dazhou Li

机构 * Shenyang University of Chemical Technology(沈阳化工大学) University of Louisville(路易斯维尔大学) Northeastern University(东北大学)

AI总结 SGDF通过动态调整动量系数优化梯度估计,提升深度学习优化性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06043 2026-03-09 cs.CV

Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

通过理解学习生成:基于理解的内在奖励用于统一多模态模型

Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司)

AI总结 本文提出GvU机制,通过内在奖励提升统一多模态模型的生成能力,同时增强其视觉理解能力,缩小理解与生成之间的能力差距。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05952 2026-03-09 cs.CV

Unify the Views: View-Consistent Prototype Learning for Few-Shot Segmentation

统一视角:用于少样本分割的视图一致原型学习

Hongli Liu, Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

AI总结 本文提出VINE框架,通过统一建模结构一致性和前景判别,提升少样本分割在视角变化和复杂结构下的性能。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05921 2026-03-09 cs.CV cs.AI

BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation

BlackMirror: 通过指令-响应偏差检测文本到图像模型的黑盒后门

Feiran Li, Qianqian Xu, Shilong Bao, Zhiyong Yang, Xilin Zhao, Xiaochun Cao, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) BDKM, University of Chinese Academy of Sciences(中国科学院大学BDKM) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Cyber Science and Tech., Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区网络安全科学与技术学院)

AI总结 BlackMirror通过指令-响应偏差检测文本到图像模型的黑盒后门,利用视觉模式与指令的对齐及偏差稳定性评估实现高效检测。

Comments This paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05908 2026-03-09 cs.CV

Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image

Pano3DComposer:从单张全景图像高效生成组合3D场景

Zidian Qiu, Ancong Wu

机构 * Sun Yat-sen University(中山大学)

AI总结 Pano3DComposer通过端到端框架从单张全景图像高效生成高精度3D场景,采用Object-World Transformation Predictor和Coarse-to-Fine对齐机制提升几何一致性。

Comments Accepted to CVPR 2026. Project page: https://qiuzidian.github.io/pano3dcomposer-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05888 2026-03-09 cs.CV cs.GR cs.LG

PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstruction

PixARMesh: 基于自回归的单视图场景重建

Xiang Zhang, Sohyun Yoo, Hongrui Wu, Chuan Li, Jianwen Xie, Zhuowen Tu

机构 * UC San Diego(加州大学圣地亚哥分校) Lambda, Inc.(Lambda公司)

AI总结 PixARMesh通过自回归方法从单张图像生成高质量3D场景网格,实现统一模型中的布局与几何联合预测,提升重建精度与实用性。

Comments CVPR 2026. Project Page: https://mlpc-ucsd.github.io/PixARMesh

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05729 2026-03-09 cs.CV

Unlocking ImageNet's Multi-Object Nature: Automated Large-Scale Multilabel Annotation

解锁ImageNet的多对象特性:自动化大规模多标签标注

Junyu Chen, Md Yousuf Harun, Christopher Kanan

机构 * University of Rochester(罗切斯特大学) Rochester Institute of Technology(罗切斯特理工学院)

AI总结 本文提出自动化方法将ImageNet训练集转换为多标签数据集,提升模型分类性能和下游任务转移能力。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05629 2026-03-09 cs.CV

Rethinking Concept Bottleneck Models: From Pitfalls to Solutions

重新思考概念瓶颈模型:从误区到解决方案

Merve Tapli, Quentin Bouniot, Wolfgang Stammer, Zeynep Akata, Emre Akbas

AI总结 CBM-Suite通过引入熵度量、非线性层和蒸馏损失,系统解决概念瓶颈模型的准确性、可解释性和系统性研究问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05078 2026-03-09 cs.CV

MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer

MoRe:面向运动的前馈4D重建Transformer

Juntong Fang, Zequn Chen, Weiqi Zhang, Donglin Di, Xuancheng Zhang, Chengmin Yang, Yu-Shen Liu

机构 * School of Software, Tsinghua University(软件学院,清华大学)

AI总结 MoRe通过注意力强制策略和分组因果注意力,高效重建动态3D场景,适用于实时应用。

Comments Accepted by CVPR 2026. Project page:https://hellexf.github.io/MoRe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01034 2026-03-09 cs.CV cs.AI cs.LG

Reparameterized Tensor Ring Functional Decomposition for Multi-Dimensional Data Recovery

重新参数化张量环功能分解用于多维数据恢复

Yangyang Xu, Junbo Ke, You-Wei Wen, Chao Wang

机构 * Key Laboratory of Computing and Stochastic Mathematics (Ministry of Education)(计算与随机数学重点实验室(教育部)) School of Mathematics and Statistics(数学与统计学学院) Department of Statistics and Data Science(统计与数据科学系)

AI总结 本文提出了一种重新参数化的张量环功能分解方法,通过结合可学习的潜在张量和固定基底,提升多维数据恢复的性能。

Comments 22 pages, 18 figures, 12 tables. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00543 2026-03-09 cs.CV

Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark

跨尺度 pansharpening 通过 ScaleFormer 和 PanScale 数据集

Ke Cao, Xuanhua He, Xueheng Li, Lingting Zhu, Yingying Wang, Ao Ma, Zhanjie Zhang, Man Zhou, Chengjun Xie, Jie Zhang

机构 * HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Xiamen University(厦门大学) Zhejiang University(浙江大学)

AI总结 本文提出 ScaleFormer 架构和 PanScale 数据集,通过跨尺度 pansharpening 方法提升多尺度场景下的图像融合质量与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22654 2026-03-09 cs.CV

Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache

去噪作为路径规划:通过DPCache实现扩散模型的训练免费加速

Bowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen, Aixi Zhang, Hao Jiang, Zhengzheng Jin, Xu Liu, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 DPCache通过全局路径规划框架实现扩散模型的高效加速,减少计算开销并提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17353 2026-03-09 eess.IV cs.CV physics.optics

Learning Latent Transmission and Glare Maps for Lens Veiling Glare Removal

学习潜在的传输和眩光地图以去除镜头遮蔽眩光

Xiaolong Qian, Qi Jiang, Lei Sun, Zongxi Yu, Kailun Yang, Peixuan Wu, Jiacheng Zhou, Yao Gao, Yaoguang Ma, Ming-Hsuan Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of California, Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

AI总结 本文提出VeilGen和DeVeiler,通过学习潜在传输和眩光地图来有效去除遮蔽眩光,提升光学系统成像质量。

Comments Accepted to CVPR 2026. All code and datasets will be publicly released at https://github.com/XiaolongQian/DeVeiler

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05506 2026-03-06 cs.CV

FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning

FaceCam: 通过尺度感知条件化实现人像视频相机控制

Weijie Lyu, Ming-Hsuan Yang, Zhixin Shu

机构 * University of California, Merced(加州大学梅尔塞德斯分校) Adobe Research(Adobe研究)

AI总结 FaceCam通过尺度感知条件化方法,提升单目人像视频的相机控制能力与视觉质量。

Comments Accepted by CVPR 2026. Project page: https://weijielyu.github.io/FaceCam

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05446 2026-03-06 cs.CV

NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries

NaiLIA:基于密集意图描述和调色板查询的多模态美甲设计检索

Kanon Amemiya, Daichi Yashima, Kei Katsumata, Takumi Komatsu, Ryosuke Korekata, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应大学)

AI总结 NaiLIA通过密集意图描述和调色板查询实现美甲设计图像的多模态检索,提升检索精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05438 2026-03-06 cs.CV cs.AI cs.RO

Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model

8个标记的规划:一种用于潜在世界模型的紧凑离散标记器

Dongwon Kim, Gawon Seo, Jinsung Lee, Minsu Cho, Suha Kwak

机构 * KAIST(韩国科学技术院) POSTECH(POSTECH大学) RLWRLD

AI总结 本文提出CompACT,一种将观测压缩为8个标记的离散标记器,显著降低计算成本并提升规划效率,为潜在世界模型的实际应用提供可行方案。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14266 2026-03-06 cs.CV

DriverGaze360: OmniDirectional Driver Attention with Object-Level Guidance

DriverGaze360: 全向驾驶员注意力与物体级引导

Shreedhar Govil, Didier Stricker, Jason Rambach

AI总结 DriverGaze360通过全向视野和物体级引导方法,实现对驾驶员注意力的高精度预测,提升自动驾驶系统中的空间感知与交互能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05235 2026-03-06 cs.AI

Reclaiming Lost Text Layers for Source-Free Cross-Domain Few-Shot Learning

恢复丢失的文本层以实现无源跨域少样本学习

Zhenyu Zhang, Guangyao Chen, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 本文提出了一种方法,通过重新利用文本编码器中被忽视的层信息,提升源无关跨域少样本学习的性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05095 2026-03-06 cs.CV cs.AI

GEM-TFL: Bridging Weak and Full Supervision for Forgery Localization through EM-Guided Decomposition and Temporal Refinement

GEM-TFL:通过EM引导分解和时间细化弥合弱监督与全监督之间的差距以实现伪造定位

Xiaodong Zhu, Yuanming Zheng, Suting Wang, Junqi Yang, Yuhong Yang, Weiping Tu, Zhongyuan Wang

机构 * NERCMS, School of Computer Science, Wuhan University(NERCMS,计算机学院,武汉大学)

AI总结 GEM-TFL通过EM引导分解和时间细化,有效弥合弱监督与全监督之间的差距,提升时间伪造定位的准确性和鲁棒性。

Comments 10 pages, 4 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05075 2026-03-06 cs.CV

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05012 2026-03-06 cs.CV

Tell2Adapt: A Unified Framework for Source Free Unsupervised Domain Adaptation via Vision Foundation Model

Tell2Adapt:通过视觉基础模型实现源无关无监督领域自适应的统一框架

Yulong Shi, Shijie Li, Ziyi Li, Lin Qi

AI总结 Tell2Adapt通过视觉基础模型实现源无关无监督领域自适应,利用上下文感知提示正则化和视觉合理性细化提升医学图像分割性能。

Comments Accepted by IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04977 2026-03-06 cs.CV

Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

思考,然后验证:一种用于长视频理解的假设-验证多智能体框架

Zheng Wang, Haoran Chen, Haoxuan Qin, Zhipeng Wei, Tianwen Qian, Cong Bai

机构 * College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机科学学院) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江视觉信息智能处理重点实验室) UC Berkeley(伯克利大学) College of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

AI总结 VideoHV-Agent通过结构化假设-验证流程提升长视频理解的准确性、可解释性和效率。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏