arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-02-25 至 2026-02-25 共收录 18
2602.21078 2026-02-25 cs.LG cs.CV

ProxyFL: A Proxy-Guided Framework for Federated Semi-Supervised Learning

ProxyFL: 一种用于联邦半监督学习的代理引导框架

Duowen Chen, Yan Wang

机构 * Shanghai Key Laboratory of Multidimensional Information Processing(上海多维信息处理重点实验室) East China Normal University(华东师范大学)

AI总结 ProxyFL通过统一代理同时缓解联邦半监督学习中的外部和内部异质性,优化全局代理以对抗异常值并重新纳入丢弃样本以减少伪标签影响。

Comments CVPR 2026. code: https://github.com/DuowenC/FSSLlib

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21010 2026-02-25 cs.CV

Le-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder Design

Le-DETR:重新审视具有高效编码器设计的实时检测变压器

Jiannan Huang, Aditya Kane, Fengzhe Zhou, Yunchao Wei, Humphrey Shi

机构 * Beijing Jiaotong University(北京交通大学)

AI总结 Le-DETR通过高效编码器设计实现低预训练成本的实时检测性能提升

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20933 2026-02-25 cs.CV

Dropping Anchor and Spherical Harmonics for Sparse-view Gaussian Splatting

丢弃锚点与球面谐波用于稀疏视角高斯点扩散

Shuangkang Fang, I-Chao Shen, Xuanyang Zhang, Zesheng Wang, Yufeng Wang, Wenrui Ding, Gang Yu, Takeo Igarashi

机构 * Beihang University(北京航空航天大学) The University of Tokyo(东京大学) StepFun

AI总结 DropAnSH-GS通过引入锚点机制和球面谐波系数的Dropout策略,有效缓解稀疏视角下3DGS的过拟合问题,提升模型鲁棒性与压缩能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20901 2026-02-25 cs.CV cs.LG

SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models

SpatiaLQA: 一个评估视觉-语言模型空间逻辑推理能力的基准

Yuechen Xie, Xiaoyan Zhang, Yicheng Shan, Hao Zhu, Rui Tang, Rong Wei, Mingli Song, Yuanyu Wan, Jie Song

机构 * Zhejiang University(浙江大学) The University of Sydney(悉尼大学) ManyCore State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 SpatiaLQA提出了一种评估视觉-语言模型空间逻辑推理能力的基准,通过递归场景图辅助推理方法提升模型在复杂场景中的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20873 2026-02-25 cs.CV

MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification

MUSE: 通过精确和多样的语义提升少样本全滑片图像分类

Jiahao Xu, Sheng Huang, Xin Zhang, Zhixiong Nan, Jiajun Dong, Nankun Mu

机构 * School of Big Data & Software Engineering, Chongqing University(大数据与软件工程学院,重庆大学) School of Computer Science & Technology, Chongqing University(计算机科学与技术学院,重庆大学)

AI总结 MUSE通过样本层面的细粒度语义增强和随机多视图生成,提升少样本全滑片图像分类的性能和鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20794 2026-02-25 cs.CV

VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving

VGGDrive: 通过跨视角几何 grounding 为自动驾驶赋能 Vision-Language 模型

Jie Wang, Guang Li, Zhijian Huang, Chenxu Dang, Hangjun Ye, Yahong Han, Long Chen

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Xiaomi EV(小米汽车)

AI总结 VGGDrive通过引入跨视角几何 grounding 机制,提升Vision-Language模型在自动驾驶任务中的性能表现。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20689 2026-02-25 cs.CV

MatchED: Crisp Edge Detection Using End-to-End, Matching-based Supervision

MatchED: 通过端到端匹配监督进行清晰边缘检测

Bedrettin Cetinkaya, Sinan Kalkan, Emre Akbas

机构 * Dept. of Computer Engineering and METU ROMER Robotics Center(计算机工程系和METU ROMER机器人中心)

AI总结 MatchED通过端到端匹配监督模块提升边缘检测清晰度,显著提高性能并超越传统后处理方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20618 2026-02-25 cs.CV

RecoverMark: Robust Watermarking for Localization and Recovery of Manipulated Faces

RecoverMark:用于定位和恢复篡改人脸的鲁棒水印

Haonan An, Xiaohui Ye, Guang Hua, Yihang Tao, Hangcheng Cao, Xiangyu Yu, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Singapore Institute of Technology(新加坡理工学院) South China University of Technology(华南理工大学)

AI总结 RecoverMark通过利用背景语义一致性和自身内容作为水印,实现鲁棒的面部篡改定位、内容恢复和知识产权保护。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20496 2026-02-25 cs.CV

Pip-Stereo: Progressive Iterations Pruner for Iterative Optimization based Stereo Matching

Pip-Stereo:基于迭代优化的立体匹配的渐进迭代剪枝器

Jintu Zheng, Qizhe Liu, HuangXin Xu, Zhuojie Chen

机构 * ARIDGE XPENG

AI总结 Pip-Stereo通过渐进迭代剪枝和硬件优化,实现高效实时立体匹配。

Comments Accepted to CVPR 2026 (3D vision track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20423 2026-02-25 cs.CV cs.CL

MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation

MedCLIPSeg: 基于概率视觉语言适应的数据高效且可泛化的医学图像分割

Taha Koleilat, Hojat Asgariandehkordi, Omid Nejati Manzari, Berardino Barile, Yiming Xiao, Hassan Rivaz

AI总结 MedCLIPSeg通过概率视觉语言适应方法,提升医学图像分割的数据效率和泛化能力,提供可解释的不确定性图。

Comments CVPR 2026; Project Page: https://tahakoleilat.github.io/MedCLIPSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20417 2026-02-25 cs.CV

gQIR: Generative Quanta Image Reconstruction

gQIR:生成式量子图像重建

Aryan Garg, Sizhuo Ma, Mohit Gupta

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Snap Inc.(Snap公司)

AI总结 gQIR通过适应大型生成模型到量子爆发成像领域,实现了在低光条件下高质量图像重建。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20412 2026-02-25 cs.CV

SimLBR: Learning to Detect Fake Images by Learning to Detect Real Images

SimLBR:通过学习检测真实图像来学习检测伪造图像

Aayush Dhakal, Subash Khanal, Srikumar Sastry, Jacob Arndt, Philipe Ambrozio Dias, Dalton Lunga, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Oak Ridge National Laboratory(橡树岭国家实验室)

AI总结 SimLBR通过学习真实图像分布来提升伪造图像检测的泛化能力和效率,实现了更高的准确率和召回率,并引入了风险调整的评估指标以增强模型鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20330 2026-02-25 cs.CV cs.AI cs.LG

Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

视觉-语言模型中的电路追踪:理解多模态思维的内部机制

Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出首个透明电路追踪框架,用于分析视觉-语言模型的多模态推理机制,揭示不同视觉特征电路在数学推理和跨模态关联中的作用。

Comments To appear in the Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09708 2026-02-25 cs.CV cs.AI cs.LG cs.RO

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

Fast-ThinkAct: 通过可言说的潜在规划实现高效的视觉-语言-动作推理

Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang

机构 * NVIDIA(英伟达)

AI总结 Fast-ThinkAct通过可言说的潜在规划实现高效的视觉-语言-动作推理,显著降低推理延迟并保持长周期规划能力。

Comments CVPR 2026. Project page: https://jasper0314-huang.github.io/fast-thinkact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23055 2026-02-25 cs.AI

MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents

MindPower: 使基于视觉语言的具身智能体具备心智理论推理能力

Ruoxuan Zhang, Qiyun Zheng, Zhiyu Zhou, Ziqi Liao, Siyu Wu, Jian-Yu Jiang-Lin, Bin Wen, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(台湾大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 MindPower通过整合感知、心理推理、决策和行动,使基于视觉语言的具身智能体具备心智理论推理能力,并在决策和行动生成上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16156 2026-02-25 cs.CV

Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers

可插拔剪枝与连续层蒸馏用于扩散变换器

Jian Ma, Qirong Peng, Xujie Zhu, Peixing Xie, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出PPCL方法,通过连续层蒸馏和灵活剪枝技术,在保持图像生成质量的同时实现50%的参数压缩,适用于资源受限环境。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12370 2026-02-25 cs.CV

Changes in Real Time: Online Scene Change Detection with Multi-View Fusion

实时变化:多视角融合的在线场景变化检测

Chamuditha Jayanga Galappaththige, Jason Lai, Lloyd Windrim, Donald Dansereau, Niko Sünderhauf, Dimity Miller

机构 * QUT Centre for Robotics(昆士兰理工大学机器人中心) ARIAM ACFR, University of Sydney(悉尼大学先进计算机研究中心) Abyss Solutions

AI总结 本文提出了一种基于多视角融合的在线场景变化检测方法,通过自监督融合损失、快速姿态估计和变化引导更新策略,在高帧率下实现了优于离线方法的性能。

Comments Accepted at CVPR 2026. Project Page: https://chumsy0725.github.io/O-SCD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11434 2026-02-25 cs.CV

Enhancing Out-of-Distribution Detection with Extended Logit Normalization

通过扩展对数归一化增强分布外检测

Yifan Ding, Xixi Liu, Jonas Unger, Gabriel Eilertsen

机构 * Linköping University(林霍普大学) Imperial College London(伦敦帝国学院)

AI总结 本文提出ELogitNorm方法,通过引入特征距离感知损失改进分布外检测并提升分布内置信度校准。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏