arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.25441 2026-03-27 eess.IV

Language-Free Generative Editing from One Visual Example

无需语言的生成编辑:一个视觉示例

Omar Elezabi, Eduard Zamfir, Zongwei Wu, Radu Timofte

AI总结 本文提出无需语言指导的视觉编辑方法VDC,通过直接从视觉示例学习条件信号,实现高精度图像编辑,优于现有无训练和全微调方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25411 2026-03-27 cs.CV

HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models

HiSpatial:在视觉-语言模型中驯服层次化3D空间理解

Huizhi Liang, Yichao Shen, Yu Deng, Sicheng Xu, Zhiyuan Feng, Tong Zhang, Yaobo Liang, Jiaolong Yang

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出一种层次化框架,通过分解VLM中3D空间理解的学习过程,从几何感知到抽象空间推理,生成多样化任务和场景的3D空间VQA对,提升视觉-语言模型的空间理解能力。

Comments Accepted by CVPR 2026. Project page: https://microsoft.github.io/HiSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25398 2026-03-27 cs.CV

PMT: Plain Mask Transformer for Image and Video Segmentation with Frozen Vision Encoders

PMT:用于图像和视频分割的Plain Mask Transformer,使用冻结的视觉编码器

Niccolò Cavagnero, Narges Norouzi, Gijs Dubbelman, Daan de Geus

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 PMT通过冻结视觉基础模型的编码器,提出Plain Mask Decoder,实现高效分割任务,兼具速度和准确性,适用于图像和视频分割。

Comments 8 pages, ECV 2026, CVPR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25336 2026-03-27 cs.CV

HeSS: Head Sensitivity Score for Sparsity Redistribution in VGGT

HeSS:用于VGGT中稀疏性再分配的头部敏感度评分

Yongsung Kim, Wooseok Song, Jaihyun Lew, Hun Hwangbo, Jaehoon Lee, Sungroh Yoon

AI总结 本文提出HeSS方法,通过量化头部稀疏性敏感度来优化VGGT的稀疏性再分配,提升模型在高稀疏度下的鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25316 2026-03-27 cs.CV

Adaptive Learned Image Compression with Graph Neural Networks

基于图神经网络的自适应学习图像压缩

Yunuo Chen, Bing He, Zezheng Lyu, Hongwei Hu, Qunshan Gu, Yuan Tian, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Massachusetts Institute of Technology(麻省理工学院) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出基于图神经网络的自适应学习图像压缩框架,通过构建双尺度图结构和动态连接性,实现灵活的数据驱动感受野,从而更高效地建模图像中的多样性冗余,提升压缩性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25250 2026-03-27 cs.CV cs.AI cs.LG

Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models

激活至关重要:基于视觉语言模型的测试时激活负标签用于分布外检测

Yabin Zhang, Maya Varma, Yunhe Gao, Jean-Benoit Delbrouck, Jiaming Liu, Chong Wang, Curtis Langlotz

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Stanford University(斯坦福大学)

AI总结 本文提出测试时激活负标签(TANL)方法,通过动态评估激活水平和测试批次内的激活信息,提升分布外检测的性能和鲁棒性,实验表明其在ImageNet基准上显著降低FPR95。

Comments CVPR 2026 main track, Codes are available at https://github.com/YBZh/OpenOOD-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25209 2026-03-27 cs.CV cs.AI

Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction

通过层适应性O.O.D校正实现免费午餐长视频生成

Jiahao Tian, Chenxi Song, Wei Cheng, Chi Zhang

机构 * Westlake University(西湖大学)

AI总结 本文提出FreeLOC框架,通过层适应性机制解决长视频生成中的O.O.D问题,提升时序一致性和视觉质量。

Comments Accepted to CVPR 2026. Code: https://github.com/Westlake-AGI-Lab/FreeLOC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25203 2026-03-27 cs.CV cs.CL

Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection

基于概率概念图推理的多模态虚假信息检测

Ruichao Yang, Wei Gao, Xiaobin Zhu, Jing Ma, Hongzhan Lin, Ziyang Luo, Bo-Wen Zhang, Xu-Cheng Yin

机构 * University of Science and Technology Beijing(北京科技大学) Singapore Management University(新加坡管理大学) Hong Kong Baptist University(香港浸会大学)

AI总结 本文提出PCGR框架,通过构建概念图进行多模态虚假信息检测,实现可解释且可进化的方法,提升检测准确性和抗新兴操纵能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25199 2026-03-27 cs.CV

TacSIm: A Dataset and Benchmark for Football Tactical Style Imitation

TacSIm: 一场足球战术风格仿真的数据集和基准

Peng Wen, Yuting Wang, Qiurui Wang

AI总结 TacSIm通过模拟英超比赛中的球员动作,提供了一种评估足球战术风格仿真的新方法,利用空间占用相似性和运动向量相似性进行量化评估。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25159 2026-03-27 cs.CV

A Semantically Disentangled Unified Model for Multi-category 3D Anomaly Detection

一种用于多类3D异常检测的语义解耦统一模型

SuYeon Kim, Wongyu Lee, MyeongAh Cho

机构 * Kyung Hee University(庆熙大学)

AI总结 本文提出一种语义解耦的统一模型,通过解耦语义表示提升多类3D异常检测的可靠性与性能,实验表明其在统一模型和类别特定模型上均取得SOTA结果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25135 2026-03-27 cs.CV

EgoXtreme: A Dataset for Robust Object Pose Estimation in Egocentric Views under Extreme Conditions

EgoXtreme:用于极端条件下眼动视角物体姿态估计的数据集

Taegyoon Yoon, Yegyu Han, Seojin Ji, Jaewoo Park, Sojeong Kim, Taein Kwon, Hyung-Sin Kim

机构 * Seoul National University(首尔大学) VGG, University of Oxford(牛津大学VGG实验室)

AI总结 本文提出EgoXtreme数据集,用于评估在极端条件下眼动视角下物体姿态估计的鲁棒性,发现现有方法在极端条件下表现不佳,需进一步改进。

Comments Camera ready version for CVPR 2026, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25118 2026-03-27 cs.CV

AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization

AnyDoc:通过大规模HTML/CSS数据合成和高度感知强化优化提升文档生成

Jiawei Lin, Wanrong Zhu, Vlad I Morariu, Christopher Tensmeyer

机构 * Xi’an Jiaotong University(西安交通大学) Adobe Research(Adobe研究院)

AI总结 AnyDoc通过大规模HTML/CSS数据合成和高度感知强化优化,实现多文档生成任务,包含265206个样本,覆盖111类和32种风格,提升文档生成性能。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25108 2026-03-27 cs.CV

MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

MSRL: 通过多阶段强化学习扩展生成多模态奖励建模

Chenglong Wang, Yifu Huo, Yang Gan, Qiaozhi He, Qi Meng, Bei Li, Yan Wang, Junfu Liu, Tianhua Zhou, Jingbo Zhu, Tong Xiao

机构 * Northeastern University, Shenyang, China(东北大学(沈阳)) ByteDance(字节跳动)

AI总结 本文提出MSRL方法,通过多阶段强化学习在有限多模态数据下扩展生成多模态奖励模型,提升视觉理解和生成任务性能,无需额外标注数据。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24295 2026-03-27 cs.CV

RS-SSM: Refining Forgotten Specifics in State Space Model for Video Semantic Segmentation

RS-SSM:通过状态空间模型细化遗忘的特定信息以实现视频语义分割

Kai Zhu, Zhenyu Cui, Zehua Zang, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Tsinghua University(清华大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出RS-SSM模型,通过互补细化遗忘的时空细节,提升视频语义分割的像素级处理能力,在四个基准上取得最佳性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23159 2026-03-27 cs.CV cs.LG

Conformal Cross-Modal Active Learning

符合性跨模态主动学习

Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Tobias Glück, Anke Schmeink, Andreas Kugi

机构 * AIT Austrian Institute of Technology(奥地利理工学院) Automation & Control Institute, Technical University of Vienna(维也纳技术大学自动化与控制研究所) Chair of Information Theory and Data Analytics (INDA), RWTH Aachen University(亚琛工业大学信息理论与数据分析教席)

AI总结 本文提出CCMA框架,通过教师-学生架构融合视觉与语言模态,利用多模态符合评分与多样性意识选择策略,提升数据效率。

Comments 20 pages, 14 figures

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22883 2026-03-27 cs.CV

Group Editing: Edit Multiple Images in One Go

组级编辑:一次操作编辑多张图像

Yue Ma, Xinyu Wang, Qianli Ma, Qinghe Wang, Mingzhe Zheng, Xiangpeng Yang, Hao Li, Chongbo Zhao, Jixuan Ying, Harry Yang, Hongyu Liu, Qifeng Chen

机构 * HKUST(香港科技大学) THU(清华大学) SJTU(上海交通大学) University of Technology Sydney(悉尼科技大学)

AI总结 本文提出组级编辑框架,通过显式和隐式关系建立实现多图像一致修改,引入融合机制和新数据集提升编辑质量与一致性。

Comments Accepted by CVPR 2026, Project page: https://group-editing.github.io/, Github: https://github.com/mayuelala/GroupEditing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21936 2026-03-27 cs.CV

Cross-Instance Gaussian Splatting Registration via Geometry-Aware Feature-Guided Alignment

跨实例高斯点云对齐 via 几何感知特征引导对齐

Roy Amoyal, Oren Freifeld, Chaim Baskin

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

AI总结 本文提出GSA方法,通过相似变换对齐不同类别的3DGS模型,无需真实尺度输入,通过迭代特征引导绝对对齐和多视图特征一致性优化,实现跨实例对齐。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19961 2026-03-27 cs.CV

Cov2Pose: Leveraging Spatial Covariance for Direct Manifold-aware 6-DoF Object Pose Estimation

Cov2Pose:利用空间协方差实现直接的流形感知6自由度物体姿态估计

Nassim Ali Ousalah, Peyman Rostami, Vincent Gaudillière, Emmanuel Koumandakis, Anis Kacem, Enjie Ghorbel, Djamila Aouada

机构 * Université de Lorraine, CNRS, Inria, LORIA(洛林大学,法国国家科学研究中心,法国国家信息与自动化研究所,洛林计算机科学及其应用实验室) Infinite Orbits(Infinite Orbits公司) Cristal Laboratory, ENSI, University of Manouba(马努巴大学国家计算机科学学院Cristal实验室)

AI总结 本文提出Cov2Pose,通过空间协方差池化实现直接姿态估计,利用SPD矩阵的流形感知网络头提升姿态回归的鲁棒性和准确性。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19682 2026-03-27 cs.CV

3D Gaussian Splatting with Self-Constrained Priors for High Fidelity Surface Reconstruction

具有自约束先验的3D高斯点云用于高保真的表面重建

Takeshi Noda, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

AI总结 本文提出自约束先验以约束3D高斯学习,提升深度渲染精度,通过融合当前3D高斯生成的深度图得到TSDF网格,生成带状约束以优化高斯分布,同时定期更新以提高准确性。

Comments Accepted by CVPR 2026. Project page: https://takeshie.github.io/GSPrior

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05181 2026-03-27 cs.CV

Mario: Multimodal Graph Reasoning with Large Language Models

Mario:基于大语言模型的多模态图推理

Yuanfu Sun, Kang Li, Pengkang Guo, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学) New York University(纽约大学) Tsinghua University(清华大学) EPFL(瑞士联邦理工学院洛桑)

AI总结 Mario通过多模态图推理框架解决跨模态一致性与异构模态偏好问题,实现对多模态图的有效推理,优于现有图模型。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05042 2026-03-27 cs.CV cs.RO

CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection

CoIn3D:重新审视配置不变的多摄像头3D目标检测

Zhaonian Kuang, Rui Ding, Haotian Wang, Xinhu Zheng, Meng Yang, Gang Hua

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) Intelligent Transportation Thrust of the Systems Hub, HKUST(GZ)(香港科技大学(广州)系统枢纽智能交通学域) Amazon Alexa AI(亚马逊Alexa人工智能)

AI总结 本文提出CoIn3D框架,通过空间先验整合和摄像头感知数据增强,提升多摄像头3D目标检测在不同配置下的泛化能力。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01010 2026-03-27 cs.CV

GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesis

GeodesicNVS: 基于概率密度几何流的新型视角合成

Xuqin Wang, Tao Wu, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang, Niclas Zeller, Daniel Cremers

机构 * Huawei Hilbert Research Center (Dresden)(华为希尔伯特研究中心(德累斯顿)) Technical University of Munich(慕尼黑工业大学) Karlsruhe University of Applied Sciences(卡尔斯鲁厄应用科学大学)

AI总结 本文提出PDG-FM方法,通过数据依赖的几何正则化提升确定性流匹配的视角一致性,实验证明在Objaverse和GSO30数据集上优于扩散模型。

Comments Accepted by CVPR 2026; Project Page see https://xuqinwang.github.io/geodesicNVS.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00141 2026-03-27 cs.CV cs.AI cs.LG eess.IV

From Scale to Speed: Adaptive Test-Time Scaling for Image Editing

从尺度到速度:面向图像编辑的自适应测试时间缩放

Xiangyan Qu, Zhenlong Yuan, Jing Tang, Rui Chen, Datao Tang, Meng Yu, Lei Sun, Yancheng Bai, Xiangxiang Chu, Gaopeng Gou, Gang Xiong, Yujun Cai

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AMAP, Alibaba Group(阿里巴巴集团高德地图) University of Queensland(昆士兰大学)

AI总结 本文提出ADE-CoT框架,通过动态资源分配、编辑特定验证和深度优先停止策略,提升图像编辑效率与性能,实验显示在同等采样预算下性能优于现有方法。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20060 2026-03-27 cs.CV cs.RO

MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving

MeanFuser: 一种基于MeanFlow的高效多模态轨迹生成与自适应重构方法用于端到端自动驾驶

Junli Wang, Yinan Zheng, Xueyi Liu, Zebin Xing, Pengfei Li, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Zhongpu Xia, Long Chen, Qichao Zhang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaomi EV(小米汽车) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院)

AI总结 本文提出MeanFuser,通过引入Gaussian Mixture Noise、MeanFlow Identity和轻量级ARM模块,实现了高效且鲁棒的多模态轨迹生成与自适应重构,提升了端到端自动驾驶的性能和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00759 2026-03-27 cs.CV

Unified Primitive Proxies for Structured Shape Completion

统一的原始代理用于结构形状补全

Zhaiyu Chen, Yuqing Wang, Xiao Xiang Zhu

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 本文提出UniCo,通过统一路径解码几何、语义和内点成员,提升结构形状补全效果,降低Chamfer距离达50%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23042 2026-03-27 cs.CV

3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds

3D无需3D扫描:从视频生成点云进行可扩展预训练

Ryousuke Yamada, Kohsuke Ide, Yoshihiro Fukuhara, Hirokatsu Kataoka, Gilles Puy, Andrei Bursuc, Yuki M. Asano

机构 * AIST(产业技术综合研究所) University of Technology Nuremberg(纽伦堡工业大学) University of Oxford(牛津大学) INRIA(法国国家信息与自动化研究所)

AI总结 本文提出LAM3C框架,通过视频生成点云进行自监督学习,无需真实3D扫描即可在室内语义和实例分割中取得更好性能。

Comments Accepted to CVPR 2026. Project page: https://ryosuke-yamada.github.io/lam3c/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19918 2026-03-27 cs.CV

Widget2Code: From Visual Widgets to UI Code via Multimodal LLMs

Widget2Code: 通过多模态大语言模型从视觉小部件到UI代码

Houston H. Zhang, Tao Zhang, Baoze Lin, Yuanqi Xue, Yincheng Zhu, Huan Liu, Li Gu, Linfeng Ye, Ziqiang Wang, Xinxin Zuo, Yang Wang, Yuanhao Yu, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Concordia University(康考迪亚大学)

AI总结 本文提出Widget2Code任务,通过多模态大语言模型提升小部件到UI代码的生成能力,设计了图像-only基准测试和WidgetFactory框架,提升视觉保真度。

Comments CVPR 2026, Code: https://github.com/Djanghao/widget2code

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09270 2026-03-27 cs.CV

MoRel: Long-Range Flicker-Free 4D Motion Modeling via Anchor Relay-based Bidirectional Blending with Hierarchical Densification

MoRel:通过基于锚点中继的双向混合与分层密集化实现长距离无闪烁的4D运动建模

Sangwoon Kwak, Weeyoung Kwon, Jun Young Jeong, Geonho Kim, Won-Sik Cheong, Jihyong Oh

AI总结 本文提出MoRel框架,通过锚点中继双向混合与分层密集化方法,实现长距离动态场景的高效4D重建,解决内存占用、时间闪烁及遮挡处理问题。

Comments CVPR 2026 (camera ready ver.). The first two authors contributed equally to this work (equal contribution). Please visit our project page at https://cmlab-korea.github.io/MoRel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02787 2026-03-27 cs.RO cs.CV

Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols

通过视觉符号诊断、纠正并学习操纵失败

Xianchao Zeng, Xinyu Zhou, Youcheng Li, Jiayou Shi, Tianle Li, Liangming Chen, Lei Ren, Yong-Lu Li

机构 * Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ViFailback框架,通过视觉符号提升标注效率,并释放大规模数据集和基准测试,验证了框架在故障诊断和纠正中的有效性。

Comments Accepted by CVPR 2026. Project Website: https://x1nyuzhou.github.io/vifailback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏