arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2511.15487 2026-02-26 cs.LG cs.CV

NTK-Guided Implicit Neural Teaching

NTK引导的隐式神经教学

Chen Zhang, Wei Zuo, Bingyang Cheng, Yikun Wang, Wei-Bin Kou, Yik Chung WU, Ngai Wong

机构 * The University of Hong Kong(香港大学)

AI总结 本文提出NTK引导的隐式神经教学方法,通过动态选择坐标加速训练,显著减少训练时间并保持表示质量。

Comments CVPR 2026 (18 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21078 2026-02-25 cs.LG cs.CV

ProxyFL: A Proxy-Guided Framework for Federated Semi-Supervised Learning

ProxyFL: 一种用于联邦半监督学习的代理引导框架

Duowen Chen, Yan Wang

机构 * Shanghai Key Laboratory of Multidimensional Information Processing(上海多维信息处理重点实验室) East China Normal University(华东师范大学)

AI总结 ProxyFL通过统一代理同时缓解联邦半监督学习中的外部和内部异质性,优化全局代理以对抗异常值并重新纳入丢弃样本以减少伪标签影响。

Comments CVPR 2026. code: https://github.com/DuowenC/FSSLlib

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21010 2026-02-25 cs.CV

Le-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder Design

Le-DETR:重新审视具有高效编码器设计的实时检测变压器

Jiannan Huang, Aditya Kane, Fengzhe Zhou, Yunchao Wei, Humphrey Shi

机构 * Beijing Jiaotong University(北京交通大学)

AI总结 Le-DETR通过高效编码器设计实现低预训练成本的实时检测性能提升

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20933 2026-02-25 cs.CV

Dropping Anchor and Spherical Harmonics for Sparse-view Gaussian Splatting

丢弃锚点与球面谐波用于稀疏视角高斯点扩散

Shuangkang Fang, I-Chao Shen, Xuanyang Zhang, Zesheng Wang, Yufeng Wang, Wenrui Ding, Gang Yu, Takeo Igarashi

机构 * Beihang University(北京航空航天大学) The University of Tokyo(东京大学) StepFun

AI总结 DropAnSH-GS通过引入锚点机制和球面谐波系数的Dropout策略,有效缓解稀疏视角下3DGS的过拟合问题,提升模型鲁棒性与压缩能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20901 2026-02-25 cs.CV cs.LG

SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models

SpatiaLQA: 一个评估视觉-语言模型空间逻辑推理能力的基准

Yuechen Xie, Xiaoyan Zhang, Yicheng Shan, Hao Zhu, Rui Tang, Rong Wei, Mingli Song, Yuanyu Wan, Jie Song

机构 * Zhejiang University(浙江大学) The University of Sydney(悉尼大学) ManyCore State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 SpatiaLQA提出了一种评估视觉-语言模型空间逻辑推理能力的基准,通过递归场景图辅助推理方法提升模型在复杂场景中的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20873 2026-02-25 cs.CV

MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification

MUSE: 通过精确和多样的语义提升少样本全滑片图像分类

Jiahao Xu, Sheng Huang, Xin Zhang, Zhixiong Nan, Jiajun Dong, Nankun Mu

机构 * School of Big Data & Software Engineering, Chongqing University(大数据与软件工程学院,重庆大学) School of Computer Science & Technology, Chongqing University(计算机科学与技术学院,重庆大学)

AI总结 MUSE通过样本层面的细粒度语义增强和随机多视图生成,提升少样本全滑片图像分类的性能和鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20794 2026-02-25 cs.CV

VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving

VGGDrive: 通过跨视角几何 grounding 为自动驾驶赋能 Vision-Language 模型

Jie Wang, Guang Li, Zhijian Huang, Chenxu Dang, Hangjun Ye, Yahong Han, Long Chen

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Xiaomi EV(小米汽车)

AI总结 VGGDrive通过引入跨视角几何 grounding 机制,提升Vision-Language模型在自动驾驶任务中的性能表现。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20689 2026-02-25 cs.CV

MatchED: Crisp Edge Detection Using End-to-End, Matching-based Supervision

MatchED: 通过端到端匹配监督进行清晰边缘检测

Bedrettin Cetinkaya, Sinan Kalkan, Emre Akbas

机构 * Dept. of Computer Engineering and METU ROMER Robotics Center(计算机工程系和METU ROMER机器人中心)

AI总结 MatchED通过端到端匹配监督模块提升边缘检测清晰度,显著提高性能并超越传统后处理方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20618 2026-02-25 cs.CV

RecoverMark: Robust Watermarking for Localization and Recovery of Manipulated Faces

RecoverMark:用于定位和恢复篡改人脸的鲁棒水印

Haonan An, Xiaohui Ye, Guang Hua, Yihang Tao, Hangcheng Cao, Xiangyu Yu, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Singapore Institute of Technology(新加坡理工学院) South China University of Technology(华南理工大学)

AI总结 RecoverMark通过利用背景语义一致性和自身内容作为水印,实现鲁棒的面部篡改定位、内容恢复和知识产权保护。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20496 2026-02-25 cs.CV

Pip-Stereo: Progressive Iterations Pruner for Iterative Optimization based Stereo Matching

Pip-Stereo:基于迭代优化的立体匹配的渐进迭代剪枝器

Jintu Zheng, Qizhe Liu, HuangXin Xu, Zhuojie Chen

机构 * ARIDGE XPENG

AI总结 Pip-Stereo通过渐进迭代剪枝和硬件优化,实现高效实时立体匹配。

Comments Accepted to CVPR 2026 (3D vision track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20423 2026-02-25 cs.CV cs.CL

MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation

MedCLIPSeg: 基于概率视觉语言适应的数据高效且可泛化的医学图像分割

Taha Koleilat, Hojat Asgariandehkordi, Omid Nejati Manzari, Berardino Barile, Yiming Xiao, Hassan Rivaz

AI总结 MedCLIPSeg通过概率视觉语言适应方法,提升医学图像分割的数据效率和泛化能力,提供可解释的不确定性图。

Comments CVPR 2026; Project Page: https://tahakoleilat.github.io/MedCLIPSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20417 2026-02-25 cs.CV

gQIR: Generative Quanta Image Reconstruction

gQIR:生成式量子图像重建

Aryan Garg, Sizhuo Ma, Mohit Gupta

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Snap Inc.(Snap公司)

AI总结 gQIR通过适应大型生成模型到量子爆发成像领域,实现了在低光条件下高质量图像重建。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20412 2026-02-25 cs.CV

SimLBR: Learning to Detect Fake Images by Learning to Detect Real Images

SimLBR:通过学习检测真实图像来学习检测伪造图像

Aayush Dhakal, Subash Khanal, Srikumar Sastry, Jacob Arndt, Philipe Ambrozio Dias, Dalton Lunga, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Oak Ridge National Laboratory(橡树岭国家实验室)

AI总结 SimLBR通过学习真实图像分布来提升伪造图像检测的泛化能力和效率,实现了更高的准确率和召回率,并引入了风险调整的评估指标以增强模型鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20330 2026-02-25 cs.CV cs.AI cs.LG

Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

视觉-语言模型中的电路追踪:理解多模态思维的内部机制

Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出首个透明电路追踪框架,用于分析视觉-语言模型的多模态推理机制,揭示不同视觉特征电路在数学推理和跨模态关联中的作用。

Comments To appear in the Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09708 2026-02-25 cs.CV cs.AI cs.LG cs.RO

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

Fast-ThinkAct: 通过可言说的潜在规划实现高效的视觉-语言-动作推理

Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang

机构 * NVIDIA(英伟达)

AI总结 Fast-ThinkAct通过可言说的潜在规划实现高效的视觉-语言-动作推理,显著降低推理延迟并保持长周期规划能力。

Comments CVPR 2026. Project page: https://jasper0314-huang.github.io/fast-thinkact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23055 2026-02-25 cs.AI

MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents

MindPower: 使基于视觉语言的具身智能体具备心智理论推理能力

Ruoxuan Zhang, Qiyun Zheng, Zhiyu Zhou, Ziqi Liao, Siyu Wu, Jian-Yu Jiang-Lin, Bin Wen, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(台湾大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 MindPower通过整合感知、心理推理、决策和行动,使基于视觉语言的具身智能体具备心智理论推理能力,并在决策和行动生成上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16156 2026-02-25 cs.CV

Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers

可插拔剪枝与连续层蒸馏用于扩散变换器

Jian Ma, Qirong Peng, Xujie Zhu, Peixing Xie, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出PPCL方法,通过连续层蒸馏和灵活剪枝技术,在保持图像生成质量的同时实现50%的参数压缩,适用于资源受限环境。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12370 2026-02-25 cs.CV

Changes in Real Time: Online Scene Change Detection with Multi-View Fusion

实时变化:多视角融合的在线场景变化检测

Chamuditha Jayanga Galappaththige, Jason Lai, Lloyd Windrim, Donald Dansereau, Niko Sünderhauf, Dimity Miller

机构 * QUT Centre for Robotics(昆士兰理工大学机器人中心) ARIAM ACFR, University of Sydney(悉尼大学先进计算机研究中心) Abyss Solutions

AI总结 本文提出了一种基于多视角融合的在线场景变化检测方法,通过自监督融合损失、快速姿态估计和变化引导更新策略,在高帧率下实现了优于离线方法的性能。

Comments Accepted at CVPR 2026. Project Page: https://chumsy0725.github.io/O-SCD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11434 2026-02-25 cs.CV

Enhancing Out-of-Distribution Detection with Extended Logit Normalization

通过扩展对数归一化增强分布外检测

Yifan Ding, Xixi Liu, Jonas Unger, Gabriel Eilertsen

机构 * Linköping University(林霍普大学) Imperial College London(伦敦帝国学院)

AI总结 本文提出ELogitNorm方法,通过引入特征距离感知损失改进分布外检测并提升分布内置信度校准。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20157 2026-02-24 cs.CV

Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learning

Flow3r: 用于可扩展视觉几何学习的因式分解流预测

Zhongxiao Cong, Qitao Zhao, Minsik Jeon, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 Flow3r通过因式分解流预测提升视觉几何学习,利用未标记视频实现动态场景的高精度重建。

Comments CVPR 2026. Project website: https://flow3r-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20068 2026-02-24 cs.CV cs.LG

The Invisible Gorilla Effect in Out-of-distribution Detection

分布外检测中的隐形大猩猩效应

Harry Anthony, Ziyun Liang, Hermione Warr, Konstantinos Kamnitsas

机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

AI总结 本文发现分布外检测中存在隐形大猩猩效应,即当异常检测对象与模型感兴趣区域在视觉上相似时,检测性能会提高,揭示了OOD检测中的潜在失败模式。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20053 2026-02-24 cs.CV

Decoupling Defense Strategies for Robust Image Watermarking

解耦防御策略用于鲁棒图像水印

Jiahui Chen, Zehang Deng, Zeyu Zhang, Chaoyang Li, Lianchen Jia, Lifeng Sun

机构 * Tsinghua University(清华大学) Swinburne University of Technology(斯威本理工大学) The Australian National University(澳大利亚国立大学) Key Laboratory of Pervasive Computing, Ministry of Education(教育部感知计算重点实验室)

AI总结 AdvMark通过解耦防御策略,提升图像水印在对抗和再生攻击下的鲁棒性,实验显示其在多种攻击下均取得显著性能提升。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07853 2026-02-24 cs.CV cs.LG

Hier-COS: Making Deep Features Hierarchy-aware via Composition of Orthogonal Subspaces

Hier-COS: 通过正交子空间的组合使深度特征层次感知

Depanshu Sani, Saket Anand

机构 * Indraprastha Institute of Information Technology(印度理工学院信息科技研究所)

AI总结 Hier-COS通过正交子空间组合提升深度特征层次感知,实现统一的细粒度与层次多级分类,克服现有评估指标缺陷,达到SOTA性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19944 2026-02-24 cs.CV

Discover, Segment, and Select: A Progressive Mechanism for Zero-shot Camouflaged Object Segmentation

发现、分割与选择:一种用于零样本伪装物体分割的渐进机制

Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学)

AI总结 本文提出DSS机制,通过特征一致的对象发现、分割细化和语义驱动的掩码选择,提升零样本伪装物体分割的性能。

Comments Accepted by CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19753 2026-02-24 cs.CV cs.GR

RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing

RAP: 快速前馈渲染-free 属性引导的原始形体重要性分数预测用于高效3D高斯点绘处理

Kaifa Yang, Qi Yang, Yiling Xu, Zhu Li

机构 * Shanghai Jiao Tong University(上海交通大学) University of Missouri–Kansas City(密苏里大学-堪萨斯城分校)

AI总结 RAP通过属性引导和高效算法,实现3DGS中原始形体重要性分数的快速预测,提升重建、压缩和传输效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19679 2026-02-24 cs.CV cs.AI

TeHOR: Text-Guided 3D Human and Object Reconstruction with Textures

TeHOR:基于文本的3D人体和物体重建与纹理

Hyeongjin Nam, Daniel Sungho Jung, Kyoung Mu Lee

机构 * Dept. of ECE&ASRI(电子工程与先进科学研究院) IPAI(人工智能研究所)

AI总结 TeHOR通过结合文本描述和外观信息,实现更准确的3D人体和物体重建,提升非接触互动的重建能力。

Comments Published at CVPR 2026, 20 pages including the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19615 2026-02-24 cs.CV

Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness

清晰可见,自信推理:用于视觉语言模型盲点的即插即用修复方法

Xin Hu, Haomiao Ni, Yunbei Zhang, Jihun Hamm, Zechen Li, Zhengming Ding

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) Department of Computer Science, University of Memphis(密苏里大学计算机科学系)

AI总结 本文提出一种无需微调的即插即用模块,通过细化视觉标记和丰富文本提示,提升VLM对罕见物体的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19611 2026-02-24 cs.CV

RAID: Retrieval-Augmented Anomaly Detection

RAID: 基于检索的异常检测

Mingxiu Cai, Zhe Zhang, Gaochang Wu, Tianyou Chai, Xiatian Zhu

机构 * State Key Laboratory of Synthetical Automation for Process Industries, Northeastern University(过程工业综合自动化 state key laboratory,东北大学)

AI总结 RAID提出了一种基于检索的无监督异常检测框架,通过利用检索到的正常样本指导噪声抑制,实现鲁棒的异常检测和定位。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19605 2026-02-24 cs.CV cs.AI cs.MM

CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning

CLCR:多模态学习中的跨层语义协作表示

Chunlei Meng, Guanhong Huang, Rong Fu, Runmin Jian, Zhongxue Gan, Chun Ouyang

机构 * Fudan University(复旦大学) Shantou University(汕头大学) University of Macau(澳门大学) Guangzhou Huashang College(广州华商学院)

AI总结 CLCR通过跨层语义协同表示方法,有效解决多模态数据中的语义错位问题,提升多模态学习的表示质量与任务泛化能力。

Comments This study has been Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏