arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-06-04 至 2026-06-04 共收录 18
2606.05071 2026-06-04 cs.CV

InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Space

InstantRetouch:基于双边空间的高效高保真指令引导图像润色

Jiarui Wu, Yujin Wang, Ruikang Li, Fan Zhang, Mingde Yao, Tianfan Xue

机构 * Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) CPII under InnoHK(创新香港下的CPII)

AI总结 提出一种基于双边空间操作的图像润色方法,通过预测低分辨率双边网格并利用学习引导图切片,结合扩散模型蒸馏和提示对齐损失,实现高效、高保真且遵循指令的图像润色。

Comments Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04925 2026-06-04 cs.CV

Scene-Centric Unsupervised Video Panoptic Segmentation

以场景为中心的无监督视频全景分割

Christoph Reich, Oliver Hahn, Nikita Araslanov, Laura Leal-Taixé, Christian Rupprecht, Daniel Cremers, Stefan Roth

机构 * TU Munich(慕尼黑技术大学) TU Darmstadt(达姆施塔特技术大学) NVIDIA(英伟达) University of Oxford(牛津大学) MCML ELIZA

AI总结 提出无监督视频全景分割任务及首个方法VideoCUPS,利用深度、运动和视觉线索生成伪标签,并通过Video DropLoss训练,在无监督条件下实现准确分割。

Comments CVPR 2026. Oliver Hahn and Christoph Reich - both authors contributed equally. Code: https://github.com/visinf/cups/tree/main/videocups Project page: https://visinf.github.io/videocups/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04688 2026-06-04 cs.CV

MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation

MeshWeaver: 稀疏体素引导的表面编织用于自回归网格生成

Jiale Xu, Wang Zhao, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG实验室)

AI总结 提出MeshWeaver框架,通过多级稀疏体素编码器注入几何上下文,以自回归方式直接预测顶点实现表面编织,在压缩比、高多边形网格生成和几何保真度上达到最优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04593 2026-06-04 cs.CV

4D Reconstruction from Sparse Dynamic Cameras

来自稀疏动态相机的4D重建

Kazuki Ozeki, Shun Kenney, Yuto Shibata, Eisuke Takeuchi, Takuya Narihira, Kazumi Fukuda, Ryosuke Sawata, Yuki Mitsufuji, Yoshimitsu Aoki

机构 * Keio University(庆应大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

AI总结 针对稀疏动态相机设置下的4D重建,提出一种通过集成跨相机特征匹配与帧内点跟踪来确保时空一致性的3D轨迹初始化方法,并引入噪声鲁棒的深度排序正则化损失和时空多样批次采样策略,在自建数据集LetCamsGo上验证了动态区域重建质量的提升。

Comments Accepted by 4DV Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04479 2026-06-04 cs.CV cs.AI cs.CL

Evaluating Reasoning Fidelity in Visual Text Generation

评估视觉文本生成中的推理保真度

Jiajun Hong, Jiawei Zhou

机构 * Stony Brook University(石桥大学)

AI总结 通过长文本渲染、事实知识探测、上下文理解和多步推理等任务,评估当前文本到图像模型在视觉文本生成中是否忠实保持推理能力,发现其常产生语义错误和逻辑不一致,与纯文本模型存在显著差距。

Comments Peer reviewed and accepted at CVPR 2026 at the GRAIL-V (Grounded Retrieval and Agentic Intelligence for Vision-Language) workshop (non-archival track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04410 2026-06-04 cs.CV

Ultra-Fast Neural Video Compression

超快神经视频压缩

Jiahao Li, Wenxuan Xie, Zhaoyang Jia, Bin Li, Zongyu Guo, Xiaoyi Zhang, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学)

AI总结 提出基于块的编码框架DCVC-UF,通过联合时空建模和并行重建实现超快编解码,显著提升率失真-复杂度权衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04299 2026-06-04 cs.CV cs.LG

Efficient and Training-Free Single-Image Diffusion Models

高效且无需训练的单图像扩散模型

Haojun Qiu, Kiriakos N. Kutulakos, David B. Lindell

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Vector Institute(向量研究所)

AI总结 提出一种基于多尺度补丁数据集的无训练单图像扩散模型,通过闭式最优去噪器实现高效生成,达到与训练模型相当的质量和多样性。

Comments CVPR 2026; Project Page: https://haojunqiu.github.io/efficient-SID/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04291 2026-06-04 cs.CV

A Cookbook of 3D Vision: Data, Learning Paradigms, and Application

3D视觉食谱:数据、学习范式与应用

Hongyang Du, Zongxia Li, Dawei Liu, Runhao Li, Haoyuan Song, Qingyu Zhang, Yubo Wang, Jingcheng Ni, Shihang Gui, Congchao Dong, Tao Hu

机构 * Brown University(布朗大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) New York University(纽约大学) The University of Sydney(悉尼大学) Stability AI

AI总结 本文提出一种以数据为中心的3D视觉分类法,通过分析点云、网格、体素和3D高斯等几何表示及其获取流程,以及数据集设计、基准构建和监督机制,统一了表示、学习范式与下游任务(重建、生成、视频建模)之间的关系。

Comments Accepted to the CVPR 2026 OpenSUN3D Workshop. Official version available at CVF Open Access. https://openaccess.thecvf.com/content/CVPR2026W/OpenSUN3D/html/Du_A_Cookbook_of_3D_Vision_Data_Learning_Paradigms_and_Application_CVPRW_2026_paper.html

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04123 2026-06-04 math.OC cs.AI cs.RO

Semantic Constraint Synthesis for Adaptive Trajectory Optimization via Large Language Models

基于大语言模型的语义约束综合用于自适应轨迹优化

Eleanor Brosius, Yuji Takubo, Daniele Gammelli, Simone D'Amico, Marco Pavone

机构 * Stanford University(斯坦福大学)

AI总结 提出利用大语言模型将自然语言描述的任务需求转化为可执行的轨迹优化代码和数学公式,在航天器交会场景中实现了从语义需求重构凸轨迹优化问题的高成功率。

Comments 7 pages, 4 figures, Presented as a short paper at IEEE CVPR 2026, AI4Space Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04107 2026-06-04 cs.CV

Reflection Separation from a Single Image via Joint Latent Diffusion

基于联合潜在扩散的单图像反射分离

Zheng-Hui Huang, Zhixiang Wang, Yu-Lun Liu, Yung-Yu Chuang

机构 * Shanda AI Research Tokyo(Shanda AI Research东京) National Taiwan University(台湾大学) National Yang Ming Chiao Tung University(阳明交通大学)

AI总结 提出一种基于扩散模型的方法,通过联合生成透射和反射层、跨层自注意力机制、分离采样策略和潜在优化,解决强光或弱反射等极端条件下的单图像反射分离问题。

Comments CVPR 2026. Project page: https://brian90709.github.io/diff-reflection-separation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22779 2026-06-04 cs.CV

TrajTok: Learning Trajectory Tokens enables better Video Understanding

TrajTok: 学习轨迹令牌以实现更好的视频理解

Chenhao Zheng, Jieyu Zhang, Jianing Zhang, Weikai Huang, Ashutosh Kumar, Quan Kong, Oncel Tuzel, Chun-Liang Li, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) Apple(苹果公司) Woven by Toyota, Inc(丰田纺织公司)

AI总结 提出TrajTok,一种端到端视频令牌化模块,通过隐式时空聚类生成对象轨迹令牌,提升视频理解效率与性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12433 2026-06-04 cs.CV cs.AI cs.LG

Revisiting Model Stitching In the Foundation Model Era

重新审视基础模型时代的模型拼接

Zheda Mai, Ke Zhang, Fu-En Wang, Zixiao Ken Wang, Albert Y. C. Chen, Lu Xia, Min Sun, Wei-Lun Chao, Cheng-Hao Kuo

机构 * The Ohio State University(俄亥俄州立大学) Boston University(波士顿大学) Amazon(亚马逊)

AI总结 本文通过系统协议研究视觉基础模型(如CLIP、DINOv2、SigLIP 2)的可拼接性,提出基于目标模型倒数第二层特征匹配损失的拼接方法,并构建VFM拼接树(VST)实现多模态大模型中多个VFM的准确率-延迟权衡。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.05814 2026-06-04 cs.CV cs.GR cs.LG cs.NA cs.RO math.NA

Probabilistic Permutation Synchronization using the Riemannian Structure of the Birkhoff Polytope

利用Birkhoff多面体的Riemannian结构的概率排列同步

Tolga Birdal, Umut Şimşekli

AI总结 本文提出了一种新的几何和概率方法,用于在多个对象或图像集合之间同步对应关系。核心方法包括基于Birkhoff-Riemannian L-BFGS优化放松后的循环一致性损失,以及基于Birkhoff-Riemannian Langevin Monte Carlo生成Birkhoff多面体样本并估计解的置信度。

Comments To appear as oral presentation at CVPR 2019. 20 pages including the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.09303 2026-06-04 math.NA cs.NA

A Decomposition Algorithm for the Sparse Generalized Eigenvalue Problem

稀疏广义本征值问题的分解算法

Ganzhao Yuan, Li Shen, Wei-Shi Zheng

AI总结 本文提出了一种新的分解算法来解决稀疏广义本征值问题,该问题在统计学习模型中广泛存在,但因其NP难而难以解决。通过随机或交换策略寻找工作集,并在小变量子集上进行全局组合搜索,结合二分搜索和坐标下降方法解决二次分数规划子问题,从而在准确度上显著优于现有方法。

Comments To appear in CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.10887 2026-06-04 stat.ML cs.CV cs.LG cs.NA math.NA

Efficient, sparse representation of manifold distance matrices for classical scaling

高效表示经典标度中的流形距离矩阵

Javier S. Turek, Alexander Huth

机构 * Intel Labs(英特尔实验室) The University of Texas at Austin(得克萨斯大学奥斯汀分校)

AI总结 本文提出一种基于双调和插值的稀疏方法,用于高效表示流形距离矩阵,相比现有方法速度快2倍,内存占用低20倍,能处理大规模点集。

Comments Conference CVPR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.01237 2026-06-04 cs.CV cs.LG cs.NA math.NA

Newton-type Methods for Inference in Higher-Order Markov Random Fields

牛顿型方法在高阶马尔可夫随机场推断中的应用

Hariprasad Kannan, Nikos Komodakis, Nikos Paragios

AI总结 本文研究了在高阶马尔可夫随机场推断中使用牛顿型方法求解拉格朗日对偶问题的益处,提出了一种收敛性可证且高效的框架,包含Hessian矩阵构建的计算复杂度与精度的平衡策略、阻尼策略、截断策略与通用预条件器的结合,以及稀疏团势能的高效求和-乘积计算。

Comments 10 pages, 3 figures, 3 tables, CVPR 2017

Journal ref Poster at IEEE International Conference on Computer Vision and Pattern Recognition 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.05804 2026-06-04 cs.CV cs.NA math.NA stat.ML

The Incremental Multiresolution Matrix Factorization Algorithm

增量多分辨率矩阵分解算法

Vamsi K. Ithapu, Risi Kondor, Sterling C. Johnson, Vikas Singh

AI总结 本文提出增量多分辨率矩阵分解算法,用于揭示对称矩阵的层次块结构,通过逐特征分析提升大规模矩阵处理能力,并在医学影像回归任务中验证其有效性。

Comments Computer Vision and Pattern Recognition (CVPR) 2017, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.05116 2026-06-04 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY

Tuning Modular Networks with Weighted Losses for Hand-Eye Coordination

通过加权损失调节模块网络以提升手眼协调

Fangyi Zhang, Jürgen Leitner, Michael Milford, Peter I. Corke

AI总结 本文提出端到端微调方法,通过加权损失提升模块化深度视觉-运动策略在平面抓取任务中的手眼协调性能。

Comments 2 pages, to appear in the Deep Learning for Robotic Vision (DLRV) Workshop in CVPR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏