arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11868
2606.04925 2026-06-04 cs.CV

Scene-Centric Unsupervised Video Panoptic Segmentation

以场景为中心的无监督视频全景分割

Christoph Reich, Oliver Hahn, Nikita Araslanov, Laura Leal-Taixé, Christian Rupprecht, Daniel Cremers, Stefan Roth

机构 * TU Munich(慕尼黑技术大学) TU Darmstadt(达姆施塔特技术大学) NVIDIA(英伟达) University of Oxford(牛津大学) MCML ELIZA

AI总结 提出无监督视频全景分割任务及首个方法VideoCUPS,利用深度、运动和视觉线索生成伪标签,并通过Video DropLoss训练,在无监督条件下实现准确分割。

Comments CVPR 2026. Oliver Hahn and Christoph Reich - both authors contributed equally. Code: https://github.com/visinf/cups/tree/main/videocups Project page: https://visinf.github.io/videocups/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04688 2026-06-04 cs.CV

MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation

MeshWeaver: 稀疏体素引导的表面编织用于自回归网格生成

Jiale Xu, Wang Zhao, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG实验室)

AI总结 提出MeshWeaver框架,通过多级稀疏体素编码器注入几何上下文,以自回归方式直接预测顶点实现表面编织,在压缩比、高多边形网格生成和几何保真度上达到最优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04593 2026-06-04 cs.CV

4D Reconstruction from Sparse Dynamic Cameras

来自稀疏动态相机的4D重建

Kazuki Ozeki, Shun Kenney, Yuto Shibata, Eisuke Takeuchi, Takuya Narihira, Kazumi Fukuda, Ryosuke Sawata, Yuki Mitsufuji, Yoshimitsu Aoki

机构 * Keio University(庆应大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

AI总结 针对稀疏动态相机设置下的4D重建,提出一种通过集成跨相机特征匹配与帧内点跟踪来确保时空一致性的3D轨迹初始化方法,并引入噪声鲁棒的深度排序正则化损失和时空多样批次采样策略,在自建数据集LetCamsGo上验证了动态区域重建质量的提升。

Comments Accepted by 4DV Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04479 2026-06-04 cs.CV cs.AI cs.CL

Evaluating Reasoning Fidelity in Visual Text Generation

评估视觉文本生成中的推理保真度

Jiajun Hong, Jiawei Zhou

机构 * Stony Brook University(石桥大学)

AI总结 通过长文本渲染、事实知识探测、上下文理解和多步推理等任务,评估当前文本到图像模型在视觉文本生成中是否忠实保持推理能力,发现其常产生语义错误和逻辑不一致,与纯文本模型存在显著差距。

Comments Peer reviewed and accepted at CVPR 2026 at the GRAIL-V (Grounded Retrieval and Agentic Intelligence for Vision-Language) workshop (non-archival track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04410 2026-06-04 cs.CV

Ultra-Fast Neural Video Compression

超快神经视频压缩

Jiahao Li, Wenxuan Xie, Zhaoyang Jia, Bin Li, Zongyu Guo, Xiaoyi Zhang, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学)

AI总结 提出基于块的编码框架DCVC-UF,通过联合时空建模和并行重建实现超快编解码,显著提升率失真-复杂度权衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04299 2026-06-04 cs.CV cs.LG

Efficient and Training-Free Single-Image Diffusion Models

高效且无需训练的单图像扩散模型

Haojun Qiu, Kiriakos N. Kutulakos, David B. Lindell

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Vector Institute(向量研究所)

AI总结 提出一种基于多尺度补丁数据集的无训练单图像扩散模型,通过闭式最优去噪器实现高效生成,达到与训练模型相当的质量和多样性。

Comments CVPR 2026; Project Page: https://haojunqiu.github.io/efficient-SID/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04291 2026-06-04 cs.CV

A Cookbook of 3D Vision: Data, Learning Paradigms, and Application

3D视觉食谱:数据、学习范式与应用

Hongyang Du, Zongxia Li, Dawei Liu, Runhao Li, Haoyuan Song, Qingyu Zhang, Yubo Wang, Jingcheng Ni, Shihang Gui, Congchao Dong, Tao Hu

机构 * Brown University(布朗大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) New York University(纽约大学) The University of Sydney(悉尼大学) Stability AI

AI总结 本文提出一种以数据为中心的3D视觉分类法,通过分析点云、网格、体素和3D高斯等几何表示及其获取流程,以及数据集设计、基准构建和监督机制,统一了表示、学习范式与下游任务(重建、生成、视频建模)之间的关系。

Comments Accepted to the CVPR 2026 OpenSUN3D Workshop. Official version available at CVF Open Access. https://openaccess.thecvf.com/content/CVPR2026W/OpenSUN3D/html/Du_A_Cookbook_of_3D_Vision_Data_Learning_Paradigms_and_Application_CVPRW_2026_paper.html

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04123 2026-06-04 math.OC cs.AI cs.RO

Semantic Constraint Synthesis for Adaptive Trajectory Optimization via Large Language Models

基于大语言模型的语义约束综合用于自适应轨迹优化

Eleanor Brosius, Yuji Takubo, Daniele Gammelli, Simone D'Amico, Marco Pavone

机构 * Stanford University(斯坦福大学)

AI总结 提出利用大语言模型将自然语言描述的任务需求转化为可执行的轨迹优化代码和数学公式,在航天器交会场景中实现了从语义需求重构凸轨迹优化问题的高成功率。

Comments 7 pages, 4 figures, Presented as a short paper at IEEE CVPR 2026, AI4Space Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04107 2026-06-04 cs.CV

Reflection Separation from a Single Image via Joint Latent Diffusion

基于联合潜在扩散的单图像反射分离

Zheng-Hui Huang, Zhixiang Wang, Yu-Lun Liu, Yung-Yu Chuang

机构 * Shanda AI Research Tokyo(Shanda AI Research东京) National Taiwan University(台湾大学) National Yang Ming Chiao Tung University(阳明交通大学)

AI总结 提出一种基于扩散模型的方法,通过联合生成透射和反射层、跨层自注意力机制、分离采样策略和潜在优化,解决强光或弱反射等极端条件下的单图像反射分离问题。

Comments CVPR 2026. Project page: https://brian90709.github.io/diff-reflection-separation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22779 2026-06-04 cs.CV

TrajTok: Learning Trajectory Tokens enables better Video Understanding

TrajTok: 学习轨迹令牌以实现更好的视频理解

Chenhao Zheng, Jieyu Zhang, Jianing Zhang, Weikai Huang, Ashutosh Kumar, Quan Kong, Oncel Tuzel, Chun-Liang Li, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) Apple(苹果公司) Woven by Toyota, Inc(丰田纺织公司)

AI总结 提出TrajTok,一种端到端视频令牌化模块,通过隐式时空聚类生成对象轨迹令牌,提升视频理解效率与性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12433 2026-06-04 cs.CV cs.AI cs.LG

Revisiting Model Stitching In the Foundation Model Era

重新审视基础模型时代的模型拼接

Zheda Mai, Ke Zhang, Fu-En Wang, Zixiao Ken Wang, Albert Y. C. Chen, Lu Xia, Min Sun, Wei-Lun Chao, Cheng-Hao Kuo

机构 * The Ohio State University(俄亥俄州立大学) Boston University(波士顿大学) Amazon(亚马逊)

AI总结 本文通过系统协议研究视觉基础模型(如CLIP、DINOv2、SigLIP 2)的可拼接性,提出基于目标模型倒数第二层特征匹配损失的拼接方法,并构建VFM拼接树(VST)实现多模态大模型中多个VFM的准确率-延迟权衡。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.05814 2026-06-04 cs.CV cs.GR cs.LG cs.NA cs.RO math.NA

Probabilistic Permutation Synchronization using the Riemannian Structure of the Birkhoff Polytope

利用Birkhoff多面体的Riemannian结构的概率排列同步

Tolga Birdal, Umut Şimşekli

AI总结 本文提出了一种新的几何和概率方法,用于在多个对象或图像集合之间同步对应关系。核心方法包括基于Birkhoff-Riemannian L-BFGS优化放松后的循环一致性损失,以及基于Birkhoff-Riemannian Langevin Monte Carlo生成Birkhoff多面体样本并估计解的置信度。

Comments To appear as oral presentation at CVPR 2019. 20 pages including the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.09303 2026-06-04 math.NA cs.NA

A Decomposition Algorithm for the Sparse Generalized Eigenvalue Problem

稀疏广义本征值问题的分解算法

Ganzhao Yuan, Li Shen, Wei-Shi Zheng

AI总结 本文提出了一种新的分解算法来解决稀疏广义本征值问题,该问题在统计学习模型中广泛存在,但因其NP难而难以解决。通过随机或交换策略寻找工作集,并在小变量子集上进行全局组合搜索,结合二分搜索和坐标下降方法解决二次分数规划子问题,从而在准确度上显著优于现有方法。

Comments To appear in CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.10887 2026-06-04 stat.ML cs.CV cs.LG cs.NA math.NA

Efficient, sparse representation of manifold distance matrices for classical scaling

高效表示经典标度中的流形距离矩阵

Javier S. Turek, Alexander Huth

机构 * Intel Labs(英特尔实验室) The University of Texas at Austin(得克萨斯大学奥斯汀分校)

AI总结 本文提出一种基于双调和插值的稀疏方法,用于高效表示流形距离矩阵,相比现有方法速度快2倍,内存占用低20倍,能处理大规模点集。

Comments Conference CVPR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.01237 2026-06-04 cs.CV cs.LG cs.NA math.NA

Newton-type Methods for Inference in Higher-Order Markov Random Fields

牛顿型方法在高阶马尔可夫随机场推断中的应用

Hariprasad Kannan, Nikos Komodakis, Nikos Paragios

AI总结 本文研究了在高阶马尔可夫随机场推断中使用牛顿型方法求解拉格朗日对偶问题的益处,提出了一种收敛性可证且高效的框架,包含Hessian矩阵构建的计算复杂度与精度的平衡策略、阻尼策略、截断策略与通用预条件器的结合,以及稀疏团势能的高效求和-乘积计算。

Comments 10 pages, 3 figures, 3 tables, CVPR 2017

Journal ref Poster at IEEE International Conference on Computer Vision and Pattern Recognition 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.05804 2026-06-04 cs.CV cs.NA math.NA stat.ML

The Incremental Multiresolution Matrix Factorization Algorithm

增量多分辨率矩阵分解算法

Vamsi K. Ithapu, Risi Kondor, Sterling C. Johnson, Vikas Singh

AI总结 本文提出增量多分辨率矩阵分解算法,用于揭示对称矩阵的层次块结构,通过逐特征分析提升大规模矩阵处理能力,并在医学影像回归任务中验证其有效性。

Comments Computer Vision and Pattern Recognition (CVPR) 2017, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.05116 2026-06-04 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY

Tuning Modular Networks with Weighted Losses for Hand-Eye Coordination

通过加权损失调节模块网络以提升手眼协调

Fangyi Zhang, Jürgen Leitner, Michael Milford, Peter I. Corke

AI总结 本文提出端到端微调方法,通过加权损失提升模块化深度视觉-运动策略在平面抓取任务中的手眼协调性能。

Comments 2 pages, to appear in the Deep Learning for Robotic Vision (DLRV) Workshop in CVPR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02642 2026-06-03 eess.AS cs.AI cs.CV cs.LG cs.MM cs.SD

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

SVHalluc: 音频-视觉大语言模型中的语音-视觉幻觉基准测试

Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh

机构 * KAIST(韩国国立信息通信研究院)

AI总结 针对音频-视觉大语言模型中的语音-视觉幻觉问题,提出SVHalluc基准,从语义和时间两个维度评估模型将语音内容与视觉信号对齐的能力,发现现有模型存在跨模态理解局限。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03985 2026-06-03 cs.RO cs.AI cs.CV

Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking

Humanoid-GPT:扩展数据与结构以实现零样本运动跟踪

Zekun Qi, Xuchuan Chen, Dairu Liu, Chenghuai Lin, Yunrui Lian, Sikai Liang, Zhikai Zhang, Yu Guan, Jilong Wang, Wenyao Zhang, Xinqiang Yu, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Galbot Inc.(Galbot公司) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 提出Humanoid-GPT,一种基于GPT风格的因果Transformer,在十亿级运动语料上预训练,实现全身控制,通过扩展数据和模型容量达到对未见运动和任务的零样本泛化。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03951 2026-06-03 cs.CV

Demo2Tutorial: From Human Experience to Multimodal Software Tutorials

Demo2Tutorial:从人类经验到多模态软件教程

Zechen Bai, Zhiheng Chen, Yiqi Lin, Kevin Qinghong Lin, Difei Gao, Xiangwu Guo, Xin Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

AI总结 提出Demo2Tutorial框架,通过屏幕录制和交互日志将人类经验解析为结构化多模态教程,用于人类学习和GUI智能体训练,实验证明其生成质量超越人工教程并提升任务效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03693 2026-06-03 cs.CL cs.CV

Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study

语言转换会破坏医学视觉语言模型吗?印度尼西亚放射学视觉问答案例研究

Pieter Christy Yan Yudhistira, Dzaki Rafif Malik, Novanto Yudistira

机构 * Intelligent System Laboratory, Faculty of Computer Science Brawijaya University(智能系统实验室,计算机科学学院布拉维亚大学)

AI总结 本研究通过构建印尼语放射学VQA数据集IndoRad-VQA,评估医学视觉语言模型在非英语临床语言下的鲁棒性,发现英语与印尼语设置间存在8-25%的性能差距,表明需要更包容的多语言评估。

Comments accepted to MMFM-BIOMED Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03666 2026-06-03 cs.CV

Beyond Single Solution: Multi-Hypothesis Collaborative Deep Unfolding Network for Image Compressive Sensing

超越单一解:用于图像压缩感知的多假设协作深度展开网络

Wenxue Cui, Hualin Li, Yuhang Qin, Yifu Xu, Xiaopeng Fan, Debin Zhao

机构 * Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute, Suzhou, China(哈尔滨工业大学苏州研究院)

AI总结 针对压缩感知问题的病态性,提出一种多假设协作深度展开网络(MHC-DUN),通过联合优化多个解空间,利用AlphaNet动态预测空间变步长进行梯度下降,并设计多假设协作近端映射模块,以提升重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03577 2026-06-03 cs.CV

Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

通过宽基线匹配激发多模态大语言模型中的复杂空间推理

Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学)

AI总结 本文提出ReasonMatch-Bench基准和动态对应强化学习(DCRL)方法,以系统评估和提升多模态大语言模型在宽基线匹配任务中的空间推理能力。

Comments CVPR 2026. Project page: https://aim-uofa.github.io/reasonmatch/ Code: https://github.com/aim-uofa/ReasonMatch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03506 2026-06-03 cs.CV cs.GR

AvatarMix: Identity-Preserving Cross-Avatar Composition for Outfit Personalization

AvatarMix: 保持身份特征的跨化身组合用于服装个性化

Zhaorong Wang, Yoshihiro Kanamori, Yuki Endo

机构 * University of Tsukuba(茨口大学)

AI总结 提出AvatarMix方法,通过直接组合两个高保真高斯化身实现服装迁移,并采用SeamFix和FullbodyFix两级细化策略解决接缝伪影和身体重塑后的外观保真问题。

Comments CVPR 2026 Findings. 16 pages, including supplementary material

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 425-435

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03479 2026-06-03 cs.CV cs.GR

PersistGS: Differentiable Physics for Object Permanence in 4D Gaussian Splatting

PersistGS: 4D高斯溅射中物体持久性的可微物理

Adrian Ramlal, John S. Zelek

机构 * University of Waterloo(滑铁卢大学)

AI总结 提出PersistGS方法,通过将可微刚体模拟与3D高斯溅射耦合,在物体被遮挡期间利用物理规律预测其SE(3)轨迹,从而恢复物体持久性,并引入质心轮廓损失降低轨迹误差。

Comments Accepted in IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 Workshop on Generative 3D Reconstruction

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 4687-4696

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02996 2026-06-03 cs.RO cs.CV cs.HC

MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial Odometry

MARIO: 运动增强的实时多传感器惯性里程计

Yiquan Li, Taeyoung Yeon, Chenfeng Gao, Vasco Xu, Xuanyou Liu, Karan Ahuja

机构 * Northwestern University(西北大学) University of Chicago(芝加哥大学)

AI总结 提出MARIO框架,通过学习IMU推断的人体姿态先验约束运动动力学,并结合多传感器融合(磁力计、气压计、辅助IMU),在Nymeria数据集上将位置漂移降低36%-42%,实现无相机人体跟踪的准确鲁棒惯性里程计。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02962 2026-06-03 cs.CV cs.AI cs.HC eess.IV

Hand Trajectory Fusion for Egocentric Natural Language Query Grounding

面向自我中心自然语言查询定位的手部轨迹融合

Enmin Zhong, Carlos R. del-Blanco, Fernando Jaureguizar, Narciso García

机构 * Grupo de Tratamiento de Imágenes (GTI), Information Processing and Telecommunications Center , ETSI Telecomunicación, Universidad Politécnica de Madrid, Spain(图像处理小组(GTI)、信息处理与电信中心、电信工程学院、马德里理工大学、西班牙)

AI总结 针对自我中心视频中的自然语言查询定位任务,提出手部轨迹编码器与自适应门控交叉注意力融合方法,利用手部运动信息提升查询定位性能。

Comments Accepted for the poster session at the Egocentric Vision (EgoVis) Workshop in Conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09233 2026-06-03 cs.CV cs.AI

Towards Robust Sequential Decomposition for Complex Image Editing

面向复杂图像编辑的鲁棒顺序分解

Zilai Zeng, Mingdeng Cao, Zijie Li, Xiaochen Lian, Yichun Shi, Peihao Zhu, Chen Sun, Peng Wang

机构 * Brown University(布朗大学) ByteDance Seed(字节跳动种子) The University of Tokyo(东京大学)

AI总结 提出通过顺序分解将复杂编辑任务拆解为简单步骤,并利用合成数据训练模型,在统一上下文编辑框架下平衡分解优势与误差累积,实现鲁棒改进和从模拟到真实的泛化。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05718 2026-06-03 cs.CV

MPM: Mutual Pair Merging for Efficient Vision Transformers

MPM:用于高效视觉Transformer的互结对合并

Simon Ravé, Pejman Rasti, David Rousseau

机构 * LARIS University of Angers(安格尔大学LARIS实验室) UMR INRAe-IRHS Angers, France(法国安格尔INRAe-IRHS UMR)

AI总结 提出无训练、无参数的互结对合并(MPM)模块,通过余弦空间互近邻配对与平均,记录合并图用于解码器前基于收集的重建,在语义分割中实现端到端加速,且精度损失小。

Comments Accepted to CVPR 2026 (Findings)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2998-3008

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19945 2026-06-03 cs.CV

Low-Resolution Editing is All You Need for High-Resolution Editing

低分辨率编辑足以实现高分辨率编辑

Junsung Lee, Hyunsoo Lee, Yong Jae Lee, Bohyung Han

机构 * ECE & IPAI, Seoul National University(电子与信息物理学院及首尔国立大学IPAI) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出一种测试时优化框架,通过分块优化、细节迁移和同步策略,实现高分辨率图像编辑。

Comments CVPR 2026. Project website: https://hleephilip.github.io/ScaleEdit

详情

展开后加载摘要…

URL PDF HTML 收藏