arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2604.08366 2026-04-10 cs.LG cs.AI cs.CV

Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems

面向端到端自动驾驶系统的缩放感知数据选择

Tolga Dimlioglu, Nadine Chang, Maying Shen, Rafid Mahmood, Jose M. Alvarez

机构 * New York University(纽约大学) NVIDIA(英伟达) University of Ottawa(渥太华大学)

AI总结 本文提出MOSAIC框架,通过分域、拟合神经缩放规律和迭代优化数据混合,提升自动驾驶模型在EPDMS指标上的性能,比基线模型减少80%的数据使用。

Comments Accepted to CVPR 2026, 8 pages of main body and 10 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08282 2026-04-10 cs.CV

Revisiting Radar Perception With Spectral Point Clouds

重新审视雷达感知与光谱点云

Hamza Alsharif, Jing Gu, Pavol Jancura, Satish Ravindran, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学) NXP Semiconductors(恩智浦半导体)

AI总结 本文提出光谱点云范式,证明稀疏点云在加入光谱信息后可媲美密集光谱数据,为统一雷达感知提供更鲁棒的输入表示。

Comments CVPR 2026 Workshop (PBVS 2026). Project page: https://www.tue-mps.org/Spectral-Point-Clouds-Radar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08238 2026-04-10 cs.CV

$\oslash$ Source Models Leak What They Shouldn't $\nrightarrow$: Unlearning Zero-Shot Transfer in Domain Adaptation Through Adversarial Optimization

$\oslash$ 源模型泄露不应泄露的信息:通过对抗优化在领域适应中消除零样本转移

Arnav Devalapally, Poornima Jain, Kartik Srinivas, Vineeth N. Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

AI总结 本文研究了领域适应中源模型泄露敏感信息的问题,提出SCADA-UL方法通过对抗优化和重新标定策略实现有效消除,实验表明其在基准数据集上表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07053 2026-04-10 cs.CV

AnchorSplat: Feed-Forward 3D Gaussian Splatting with 3D Geometric Priors

AnchorSplat: 基于3D几何先验的馈送式3D高斯点描绘

Xiaoxue Zhang, Xiaoxu Zheng, Yixuan Yin, Tiao Zhao, Kaihua Tang, Michael Bi Mi, Zhan Xu, Dave Zhenyu Chen

机构 * Huawei Technologies Ltd.(华为技术有限公司)

AI总结 本文提出AnchorSplat,一种基于3D几何先验的馈送式3D高斯点描绘方法,通过直接在3D空间中表示场景,减少高斯数量,提升重建精度和计算效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17489 2026-04-10 cs.CV

LumiCtrl : Learning Illuminant Prompts for Lighting Control in Personalized Text-to-Image Models

LumiCtrl : 基于光照提示的学习以实现个性化文本到图像模型中的光照控制

Muhammad Atif Butt, Kai Wang, Javier Vazquez-Corral, Joost Van De Weijer

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) City University of Hong Kong(香港城市大学) Computer Sciences Department, Universitat Autònoma de Barcelona, Spain(西班牙巴塞罗那自治大学计算机科学系) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目)

AI总结 本文提出LumiCtrl方法,通过学习单个物体图像的光照提示,实现对文本到图像模型中光照的精准控制,提升生成图像的光照真实性、审美质量和场景一致性。

Comments Accepted to IEEE/CVF CVPR 2026 Workshop on AI for Creative Visual Content Generation, Editing, and Understanding (CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09928 2026-04-10 cs.RO

HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性

Minghui Lin, Pengxiang Ding, Shu Wang, Zifeng Zhuang, Yang Liu, Xinyang Tong, Wenxuan Song, Shangke Lyu, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学) Westlake Robotics(西湖机器人)

AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。

Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08192 2026-04-10 cs.LG cs.CV

Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings

从内到外:通过模型内部机制衡量视觉变换器的泛化能力

Yunxiang Peng, Mengmeng Ma, Ziyu Yao, Xi Peng

机构 * University of Delaware(特拉华大学) George Mason University(乔治梅森大学)

AI总结 本文提出依赖深度偏差和电路移位分数两种指标,通过分析模型内部电路来评估泛化能力,显著提升与实际泛化性能的关联性。

Comments CVPR 2026(Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08167 2026-04-10 cs.CV

T-Gated Adapter: A Lightweight Temporal Adapter for Vision-Language Medical Segmentation

T-Gated Adapter:一种轻量级时间适配器用于视觉-语言医学分割

Pranjal Khadka

机构 * Independent Researcher(独立研究员)

AI总结 本文提出T-Gated Adapter,通过注入相邻切片上下文提升医学图像分割的连续性,实验表明在FLARE22、BTCV和AMOS22数据集上均取得显著提升,且在跨模态任务中表现优于传统3D模型。

Comments Accepted at the PHAROS-AIF-MIH Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08074 2026-04-10 cs.CV

DinoRADE: Full Spectral Radar-Camera Fusion with Vision Foundation Model Features for Multi-class Object Detection in Adverse Weather

DinoRADE:基于视觉基础模型特征的全谱雷达-摄像头融合用于恶劣天气下的多类目标检测

Christof Leitgeb, Thomas Puchleitner, Max Peter Ronecker, Daniel Watzenig

机构 * Infineon Technologies AG, Austria(英飞凌科技公司,奥地利) Graz University of Technology, Austria(格拉茨技术大学,奥地利) Virtual Vehicle Research GmbH, Austria(虚拟车辆研究有限公司,奥地利)

AI总结 本文提出DinoRADE,通过雷达-摄像头融合和视觉基础模型特征提升恶劣天气下的多类目标检测性能,首次在K-Radar数据集上评估并超越现有方法12.1%。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08060 2026-04-10 eess.IV

TinyDEVO: Deep Event-based Visual Odometry on Ultra-low-power Multi-core Microcontrollers

TinyDEVO: 在超低功耗多核微控制器上实现深度事件视觉里程计

Alessandro Marchei, Lorenzo Lamberti, Daniele Palossi, Luca Benini

AI总结 本文提出TinyDEVO,一种针对资源受限微控制器的事件视觉里程计模型,通过优化架构和超参数调优,将内存占用和运算量分别降低11.5倍和29.7倍,同时保持较高的轨迹精度。

Comments 10 pages, 5 Figures, 5 Tables. This paper has been accepted for publication in the IEEE IEEE Conference on Computer Vision and Pattern Recognition Workshops. Copyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08048 2026-04-10 cs.CV

Guiding a Diffusion Model by Swapping Its Tokens

通过交换令牌引导扩散模型

Weijia Zhang, Yuehao Liu, Shanyan Guan, Wu Ran, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

AI总结 本文提出一种简单方法,通过交换令牌实现条件和无条件生成的CFG引导,提升图像质量和提示对齐。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08042 2026-04-10 cs.CV cs.AI

3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience

3DrawAgent:通过早期对比经验教LLM进行3D绘制

Hongcan Xiao, Xinyue Xiao, Yilin Wang, Yue Zhang, Yonggang Qi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Jiangnan University(江南大学) HaoHan Data(浩瀚数据)

AI总结 3DrawAgent通过几何反馈利用大语言模型生成3D贝塞尔曲线,引入相对经验优化策略,无需参数更新提升3D空间理解与绘制质量,实现免训练的3D草图智能发展。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08008 2026-04-10 cs.CV cs.AI cs.LG

SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving

SearchAD:大规模稀有图像检索数据集用于自动驾驶

Felix Embacher, Jonas Uhrig, Marius Cordts, Markus Enzweiler

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃斯林根应用技术大学智能系统研究所)

AI总结 SearchAD为自动驾驶提供大规模稀有图像检索数据集,包含423k帧和513k个标注框,针对稀有类别检索问题,支持文本到图像和图像到图像检索及少样本学习。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07997 2026-04-10 cs.CV

Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments

少样本增量式动态室内环境3D物体检测

Yun Zhu, Jianjun Qian, Jian Yang, Jin Xie, Na Zhao

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出FI3Det框架,利用视觉语言模型学习未见类别知识,通过VLM引导模块和多模态原型模块实现高效3D感知,在ScanNet V2和SUN RGB-D数据集上取得显著提升。

Comments Accepted by CVPR 2026

Journal ref CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07966 2026-04-10 cs.CV

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

基于渲染的视频生成与基于代理的推理

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07965 2026-04-10 cs.CV cs.AI cs.LG

DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing

DSCA: 动态子空间概念对齐用于终身视觉语言模型编辑

Gyanendra Das, Sai Satyam Jena

机构 * Zynix AI, FL, USA(Zynix AI(美国佛罗里达州))

AI总结 DSCA通过动态子空间对齐技术,在视觉语言模型中实现精准非干扰编辑,提升终身学习的稳定性与知识保留能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07890 2026-04-10 cs.CV

Sampling-Aware 3D Spatial Analysis in Multiplexed Imaging

多维成像中考虑采样几何的3D空间分析

Ido Harlev, Tamar Oukhanov, Raz Ben-Uri, Leeat Keren, Shai Bagon

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

AI总结 本文研究采样几何对常用空间统计稳定性的影响,提出一种几何感知重建模块,通过连续切片实现稀疏但一致的3D分析,验证了在有限预算下稀疏3D重建的实用价值。

Comments Accepted to The 11th IEEE Workshop on Computer Vision for Multimodal Microscopy Image Analysis (CVMI), a CVPR 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07812 2026-04-10 cs.CV

HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

HAWK:多模态模型中的头部重要性感知视觉标记修剪

Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies, Inc(长鑫存储技术有限公司) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

AI总结 HAWK通过识别不同注意力头在视觉任务中的重要性,有效保留关键视觉标记,提升多模态模型的推理效率与性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07774 2026-04-10 cs.RO cs.CV

RoboAgent: Chaining Basic Capabilities for Embodied Task Planning

RoboAgent: 通过基本能力串联实现具身任务规划

Peiran Xu, Jiaqi Zheng, Yadong Mu

机构 * Peking University(北京大学) XYZ Embodied AI(XYZ具身智能)

AI总结 本文提出RoboAgent,通过串联基本能力实现具身任务规划,利用单个VLM构建能力驱动的规划框架,结合多阶段训练方法提升规划效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07723 2026-04-10 cs.CV

Direct Segmentation without Logits Optimization for Training-Free Open-Vocabulary Semantic Segmentation

无需logits优化的直接分割用于无训练开放词汇语义分割

Jiahao Li, Yang Lu, Yachao Zhang, Fangyong Wang, Yuan Xie, Yanyun Qu

机构 * Hanjiang National Laboratory(汉江国家实验室) East China Normal University(华东师范大学)

AI总结 本文提出无需logits优化的直接分割方法,通过分析分布差异直接生成语义分割图,省去迭代训练和模型特定注意力调节,实现八种基准数据集上的最佳性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07634 2026-04-10 cs.CV

VSAS-BENCH: Real-Time Evaluation of Visual Streaming Assistant Models

VSAS-BENCH:视觉流助手模型的实时评估

Pavan Kumar Anasosalu Vasu, Cem Koc, Fartash Faghri, Chun-Liang Li, Bo Feng, Zhengfeng Lai, Meng Cao, Oncel Tuzel, Hadi Pouransari

机构 * Apple(苹果公司)

AI总结 本文提出VSAS-Bench,通过时序密集标注和标准化评估协议,评估流式视觉语言模型的实时性能,揭示模型在内存缓冲长度、访问策略等关键设计因素下的精度-延迟权衡。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07606 2026-04-10 cs.CV

Bootstrapping Sign Language Annotations with Sign Language Models

通过手语模型 bootstrap 手语注释

Colin Lea, Vasileios Baltatzis, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater

机构 * Apple(苹果公司) Gallaudet University(加劳德特大学)

AI总结 本文提出一种伪注释流程,利用手语视频和英语输入,生成手语、手指拼写词和手语分类器的注释。通过稀疏预测和K-Shot LLM方法,实现高精度的伪注释,为手语数据集提供高质量基准。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07577 2026-04-10 cs.CV

Event-Level Detection of Surgical Instrument Handovers in Videos with Interpretable Vision Models

视频中手术器械交接的事件级检测:可解释的视觉模型

Katerina Katsarou, George Zountsas, Karam Tomotaki-Dawoud, Alexander Ehrenhoefer, Paul Chojecki, David Przewozny, Igor Maximilian Sauer, Amira Mouakher, Sebastian Bosse

机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) Technical University of Berlin(柏林工业大学) Charité - Universitätsmedizin Berlin(柏林夏里特医学院) Université de Perpignan(佩皮尼昂大学)

AI总结 本文提出一种时空视觉框架,用于检测和分类手术器械交接事件,通过结合视觉Transformer和LSTM网络,实现高准确率的检测与方向分类,实验表明其在肾移植手术视频中表现优异。

Comments 12 Pages, 6 figures, CVPR 2026 Workshop AI4RWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07399 2026-04-10 cs.LG

Critical Patch-Aware Sparse Prompting with Decoupled Training for Continual Learning on the Edge

面向边缘设备的持续学习中关键补丁感知稀疏提示方法

Wonseon Lim, Jaesung Lee, Dae-Won Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(中央大学计算机科学与工程学院) Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

AI总结 本文提出CPS-Prompt方法,通过关键补丁采样和解耦训练降低边缘设备上的训练内存和计算成本,实验证明其在内存、训练时间和能效方面优于基线模型,同时保持与现有方法相当的精度。

Comments Accepted to CVPR 2026. 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07397 2026-04-10 cs.LG cs.AI

Data Warmup: Complexity-Aware Curricula for Efficient Diffusion Training

数据预热:面向高效扩散训练的复杂度感知课程学习

Jinhong Lin, Pan Wang, Zitong Zhan, Lin Zhang, Pedro Morgado

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University at Buffalo, SUNY(纽约州立大学布法罗分校)

AI总结 本文提出Data Warmup方法,通过按复杂度从简到繁安排训练图像,提升扩散模型训练效率,实验表明其在ImageNet上显著提升生成质量并提前达到基线水平。

Comments CVPRW in the proceedings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16570 2026-04-10 cs.CV

Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration

Face2Scene:利用面部退化作为扩散基于场景恢复的 oracle

Amirhossein Kazerouni, Maitreya Suin, Tristan Aumentado-Armstrong, Sina Honari, Amanpreet Walia, Iqbal Mohomed, Konstantinos G. Derpanis, Babak Taati, Alex Levinshtein

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) AI Center–Toronto, Samsung Electronics(三星电子多伦多AI中心) University Health Network(大学健康网络) York University(约克大学)

AI总结 本文提出Face2Scene框架,通过面部作为感知oracle估计退化并指导全图恢复,有效恢复身体和背景。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20223 2026-04-10 cs.LG cs.AI

MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learning

多模态PFN:扩展先验数据拟合网络以进行多模态表格学习

Wall Kim, Chaeyoung Song, Hanul Kim

机构 * Samsung Electronics(三星电子) Seoul National University of Science and Technology(首尔科学技术大学)

AI总结 本文提出MMPFN,通过引入多头门控MLP和跨注意力池化器,扩展TabPFN以处理表格和非表格模态,实验证明其在医疗和通用多模态数据集上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20524 2026-04-10 cs.CV

AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors

AnomalyVFM -- 将视觉基础模型转变为零样本异常检测器

Matic Fučka, Vitjan Zavrtanik, Danijel Skočaj

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院)

AI总结 本文提出AnomalyVFM框架,通过合成数据生成与参数高效适应机制,使视觉基础模型在零样本异常检测中表现更优,实测在9个数据集上达到94.1%的AUROC。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18662 2026-04-10 cs.RO cs.CV

Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments

伪专家正则化离线强化学习用于逼真闭环环境中的端到端自动驾驶

Chihiro Noguchi, Takaki Yamamoto

机构 * InfoTech, Toyota Motor Corporation(丰田汽车公司 InfoTech)

AI总结 本文提出一种基于摄像头的端到端离线强化学习框架,通过伪地面真实轨迹正则化提升自动驾驶安全性与效率,实验表明在nuScenes数据集上显著降低碰撞率并提高路线完成度。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏