arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11874
2604.01474 2026-04-03 cs.CV cs.LG

Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptation

一次优先,然后局部重新编程:一种高效替代黑盒服务模型适应的方法

Yunbei Zhang, Chengyi Cai, Feng Liu, Jihun Hamm

机构 * Tulane University(杜兰大学) University of Melbourne(墨尔本大学)

AI总结 本文提出AReS方法,通过一次交互预训练局部编码器,减少API调用成本,提升现代闭盒模型的适应性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01466 2026-04-03 cs.RO cs.CV cs.LG

Efficient Equivariant Transformer for Self-Driving Agent Modeling

高效等价变换器用于自动驾驶代理建模

Scott Xu, Dian Chen, Kelvin Wong, Chris Zhang, Kion Fallah, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

AI总结 本文提出DriveGATr,一种基于变换器的架构,通过多向量在2D投影几何代数中建模几何关系,实现SE(2)-等价性,无需显式成对相对位置编码,提升大规模场景下的效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01421 2026-04-03 cs.CV

EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

EgoFlow:基于梯度的流匹配用于第一人称6自由度物体运动生成

Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML(慕尼黑机器学习中心) ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出EgoFlow,通过多模态第一人称观察生成物理合理的物体运动轨迹,结合Mamba-Transformer-Perceiver架构和梯度引导推理,提升运动生成的准确性和物理真实性。

Comments CVPR 2026: https://abhi-rf.github.io/egoflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29272 2026-04-03 cs.CV cs.GR cs.RO

MaskAdapt: Learning Flexible Motion Adaptation via Mask-Invariant Prior for Physics-Based Characters

MaskAdapt:通过mask不变先验实现灵活的运动适应

Soomin Park, Eunseong Lee, Kwang Bin Lee, Sung-Hee Lee

机构 * KAIST(韩国科学技术院)

AI总结 MaskAdapt通过两阶段残差学习框架,结合随机身体部分遮挡和正则化项训练mask不变基础策略,实现物理基人物体的灵活运动适应,展示了运动合成和文本驱动部分目标跟踪的应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23711 2026-04-03 cs.CV

Mind the Hitch: Dynamic Calibration and Articulated Perception for Autonomous Trucks

注意挂钩:面向自动驾驶卡车的动态校准与关节感知

Morui Zhu, Yongqi Zhu, Song Fu, Qing Yang

机构 * University of North Texas(北德克萨斯大学)

AI总结 本文提出dCAP框架,通过动态校准和关节感知解决自动驾驶卡车中铰接结构带来的挑战,提升3D目标检测精度。

Comments CVPR 2026 camera-ready version (minor revision & supplementary included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17979 2026-04-03 cs.CV

AdaRadar: Rate Adaptive Spectral Compression for Radar-based Perception

AdaRadar: 基于雷达感知的自适应频谱压缩

Jinho Park, Se Young Chun, Mingoo Seok

机构 * Columbia University(哥伦比亚大学) Seoul National University(首尔国立大学)

AI总结 本文提出AdaRadar,通过自适应反馈机制实现雷达数据压缩,动态调整压缩比并利用零阶梯度近似,结合离散余弦变换和量化技术,实现超过100倍的特征尺寸缩减,性能损失仅约1%。

Comments Accepted to CVPR 2026. Project page: https://jp4327.github.io/adaradar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23791 2026-04-03 eess.IV cs.CV

FluoCLIP: Stain-Aware Focus Quality Assessment in Fluorescence Microscopy

FluoCLIP:荧光显微镜中考虑染色的聚焦质量评估

Hyejin Park, Jiwon Yoon, Sumin Park, Suree Kim, Sinae Jang, Eunsoo Lee, Dongmin Kang, Dongbo Min

机构 * Division of AI and Software, Ewha Womans University(梨花女子大学人工智能与软件学部) Bioimaging Data Curation Center (BDCC), Department of Life Science, Ewha Womans University(梨花女子大学生命科学系生物成像数据管理中心) Analytical Solution Team, Daesang Corporation(大象集团分析解决方案团队)

AI总结 本文提出FluoCLIP,一种两阶段视觉-语言框架,用于荧光显微镜中考虑染色的聚焦质量评估,通过显式建模染色依赖的聚焦行为,优于传统方法和最新视觉-语言基线。

Comments Accepted at CVPR 2026, Project Page: https://fluoclip.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20985 2026-04-03 cs.CV

EW-DETR: Evolving World Object Detection via Incremental Low-Rank DEtection TRansformer

EW-DETR: 通过增量低秩检测Transformer实现进化世界目标检测

Munish Monga, Vishal Chudasama, Pankaj Wasnik, C. V. Jawahar

机构 * Sony Research India(索尼印度研究院) IIIT Hyderabad(海德拉巴国际信息技术学院)

AI总结 本文提出EW-DETR框架,结合增量学习、领域自适应和未知检测,在无示例约束下实现进化世界目标检测,通过三个协同模块提升性能,实验表明其在Pascal系列和多天气基准上表现优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06393 2026-04-03 cs.IR

MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model

MuCo:多轮对比学习用于多模态嵌入模型

Geonmo Gu, Byeongho Heo, Jaemyung Yu, Jaehui Hwang, Taekyung Kim, Sangmin Lee, HeeJae Jun, Yoohoon Kang, Sangdoo Yun, Dongyoon Han

AI总结 本文提出MuCo,一种基于对话的多轮对比学习框架,通过多轮查询-目标对提升多模态嵌入模型的训练效率和表征一致性。

Comments CVPR 2026 camera-ready; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15475 2026-04-03 cs.CV

Seeing through Light and Darkness: Sensor-Physics Grounded Deblurring HDR NeRF from Single-Exposure Images and Events

透过光与暗:基于传感器物理的去模糊HDR NeRF从单曝光图像和事件

Yunshan Qi, Lin Zhu, Nan Bao, Yifan Zhao, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

AI总结 本文提出基于传感器物理的NeRF框架,通过单曝光模糊LDR图像和对应事件实现高动态范围和锐利3D表示的合成,利用CRF模型提升HDR和去模糊效果。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. Project Page: https://icvteam.github.io/See-NeRF.html. Our code and datasets are publicly available at https://github.com/iCVTEAM/See-NeRF

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11508 2026-04-03 cs.CV

ReScene4D: Temporally Consistent Semantic Instance Segmentation of Evolving Indoor 3D Scenes

ReScene4D: 时空一致的动态室内3D场景语义实例分割

Emily Steiner, Jianhao Zheng, Henry Howard-Jenkins, Chris Xie, Iro Armeni

机构 * Stanford University(斯坦福大学) Meta Reality Labs Research(Meta现实实验室)

AI总结 ReScene4D提出了一种新的4D室内语义实例分割方法,通过时空对比损失、掩码和序列化技术,在无需密集观测的情况下实现实例跟踪和性能提升,引入t-mAP指标评估时空一致性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21681 2026-04-03 cs.CV

Seeing without Pixels: Perception from Camera Trajectories

无需像素的感知:从相机轨迹进行感知

Zihui Xue, Kristen Grauman, Dima Damen, Andrew Zisserman, Tengda Han

机构 * Google DeepMind(谷歌DeepMind) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文探讨通过相机轨迹而非像素感知视频内容的可能性,提出CamFormer框架,证明轨迹信息能有效用于视频内容理解及多种下游任务。

Comments Accepted by CVPR 2026, Project website: https://sites.google.com/view/seeing-without-pixels

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18123 2026-04-03 cs.CV cs.AI cs.CL cs.LG

Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models

偏差是子空间,而非坐标:视觉-语言模型中事后去偏的几何重思

Dachuan Zhao, Weiyue Li, Zhenda Shen, Yushu Qiu, Bowen Xu, Haoyu Chen, Yongchao Chen

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

AI总结 本文提出SPD框架,通过几何方法识别并去除线性可解码的偏子空间,提升视觉-语言模型的公平性与任务性能。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22652 2026-04-03 cs.RO cs.CV

Pixel Motion Diffusion is What We Need for Robot Control

我们为机器人控制需要像素运动扩散

E-Ro Nguyen, Yichi Zhang, Kanchana Ranasinghe, Xiang Li, Michael S. Ryoo

机构 * Stony Brook University(石溪大学)

AI总结 DAWN框架通过结构化像素运动表示连接高层运动意图与底层机器人动作,实现端到端可训练系统,展示多任务性能和现实迁移能力。

Comments Accepted to CVPR 2026. Project page: https://eronguyen.github.io/DAWN

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10739 2026-04-03 cs.MM eess.IV

HippoMM: Hippocampal-inspired Multimodal Memory for Long Audiovisual Event Understanding

HippoMM:基于海马体的多模态记忆用于长音频视频事件理解

Yueqian Lin, Jingyang Zhang, Qinsi Wang, Hancheng Ye, Yuzhe Fu, Yudong Liu, Hai "Helen" Li, Yiran Chen

AI总结 HippoMM通过整合事件分割、记忆巩固和分层记忆检索,实现长音频视频事件理解,达到78.2%的准确率,比基线模型快5倍。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05808 2026-04-03 cs.CV

Fast Sphericity and Roundness approximation in 2D and 3D using Local Thickness

二维和三维中基于局部厚度的快速球形度和圆度近似

Pawel Tomasz Pieta, Peter Winkel Rasumssen, Anders Bjorholm Dahl, Anders Nymark Christensen

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 本文提出基于局部厚度算法的新型方法,用于高效计算二维和三维图像中物体的球形度和圆度,通过简化表面面积计算和避免复杂角曲率确定过程,提升计算效率。

Comments Accepted at CVMI (CVPR 2025 Workshop)

Journal ref Proceedings of 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 4667-4677

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04727 2026-04-03 eess.IV cs.CV

Learning to Translate Noise for Robust Image Denoising

学习噪声翻译以实现稳健的图像去噪

Inju Ha, Donghun Ryou, Seonguk Seo, Bohyung Han

机构 * Seoul National University(首尔大学) Meta

AI总结 本文提出噪声翻译框架,通过将复杂噪声转换为高斯噪声以提升图像去噪的鲁棒性和泛化能力,采用预训练的去噪网络实现一致的去噪效果。

Comments Project page: https://hij1112.github.io/learning-to-translate-noise/ Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01082 2026-04-02 cs.CV cs.GR

ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Data

ReMoGen:通过多样化数据的模块学习实现实时的人际交互生成

Yaoqin Ye, Yiteng Xu, Qin Sun, Xinge Zhu, Yujing Sun, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Guangzhou Institute of Energy Conversion, CAS(中国科学院广州能源研究所) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出ReMoGen框架,通过模块化学习生成实时的人际交互反应,利用大规模单人动作数据集学习通用动作先验,并通过Meta-Interaction模块适应不同交互领域,实现高效且高质量的动作响应。

Comments accepted by CVPR 2026, project page: https://4dvlab.github.io/project_page/remogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01081 2026-04-02 cs.CV cs.LG cs.RO eess.IV

ProOOD: Prototype-Guided Out-of-Distribution 3D Occupancy Prediction

ProOOD:基于原型的分布外3D占用预测

Yuheng Zhang, Mengfei Duan, Kunyu Peng, Yuhang Wang, Di Wen, Danda Pani Paudel, Luc Van Gool, Kailun Yang

机构 * Hunan University(湖南大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

AI总结 本文提出ProOOD方法,通过原型引导的语义填充和尾部挖掘提升3D占用预测和分布外检测性能,实验表明其在多个数据集上均取得显著改进。

Comments Accepted to CVPR 2026. The source code is publicly available at https://github.com/7uHeng/ProOOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00969 2026-04-02 cs.CV

DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

DLWM:双潜在世界模型实现自动驾驶中的整体高斯中心预训练

Yiyao Zhu, Ying Xue, Haiming Zhang, Guangfeng Jiang, Wending Zhou, Xu Yan, Jiantao Gao, Yingjie Cai, Bingbing Liu, Zhen Li, Shaojie Shen

机构 * HKUST(香港科技大学) CUHK-SZ(香港中文大学(深圳)) USTC(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部门)

AI总结 本文提出DLWM,通过双潜在世界模型实现自动驾驶中的整体高斯中心预训练,提升3D占用感知、4D占用预测和运动规划性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00849 2026-04-02 cs.CV

Disentangling to Re-couple: Resolving the Similarity-Controllability Paradox in Subject-Driven Text-to-Image Generation

解耦以再耦合:在主体驱动的文本到图像生成中解决相似性-可控性悖论

Shuang Li, Chao Deng, Hang Chen, Liqun Liu, Zhenyu Hu, Te Cao, Mengge Xue, Yuan Chen, Peng Shu, Huan Yu, Jie Jiang

机构 * Tencent(腾讯)

AI总结 本文提出DisCo框架,通过解耦和再耦合视觉与文本信息,解决主体驱动文本到图像生成中相似性与可控性矛盾问题,实现高保真主体保持与精确文本控制。

Comments Accepted by CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00827 2026-04-02 cs.CV

Video Patch Pruning: Efficient Video Instance Segmentation via Early Token Reduction

视频补丁剪枝:通过早期令牌减少实现高效的视频实例分割

Patrick Glandorf, Thomas Norrenbrock, Bodo Rosenhahn

AI总结 本文提出VPP框架,利用时间先验知识实现早期ViT层的高效稀疏性,实现高达60%的补丁减少,在密集预测任务中超越传统图像基补丁剪枝方法,保持在补丁使用低于55%时的稳定性能。

Comments CVPR'26 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00597 2026-04-02 cs.CV

Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors

面向视角鲁棒的端到端自动驾驶与3D基础模型先验

Hiroki Hashimoto, Hiromichi Goto, Hiroyuki Sugai, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国立信息学研究所)

AI总结 本文提出一种无需数据增强的端到端自动驾驶方法,利用3D基础模型的几何先验提升视角变化鲁棒性,实验显示在pitch和高度扰动下性能提升显著。

Comments Accepted at CVPR Workshop on Simulation for Autonomous Driving 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00559 2026-04-02 cs.CV

FecalFed: Privacy-Preserving Poultry Disease Detection via Federated Learning

FecalFed: 通过联邦学习实现隐私保护的家禽疾病检测

Tien-Yu Chi

AI总结 本文提出FecalFed框架,通过联邦学习解决家禽疾病检测中的数据隐私和异构性问题,释放了高质量数据集,并展示了在非独立同分布条件下实现高准确率的隐私保护方法。

Comments Accepted to the CVPR 2026 Workshop on Vision for Agriculture

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00530 2026-04-02 cs.CV

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00519 2026-04-02 cs.CV

Learnability-Guided Diffusion for Dataset Distillation

基于可学习性的扩散模型用于数据集蒸馏

Jeffrey A. Chan-Santiago, Mubarak Shah

AI总结 本文提出基于可学习性的数据集蒸馏方法,通过逐步构建合成数据集,减少冗余信号,提升模型性能,在ImageNet-1K等数据集上取得最佳结果。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00452 2026-04-02 cs.CV

Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State Manipulation

视而不见,失之跟踪:通过查询状态操控对基于传播的多目标跟踪器进行对抗攻击

Halima Bouzidi, Haoyu Liu, Yonatan Gizachew Achamyeleh, Praneetsai Vasu Iddamsetty, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

AI总结 本文提出FADE框架,通过操控查询状态攻击基于传播的多目标跟踪器,导致身份切换和跟踪终止。

Comments Accepted for presentation at CVPR 2026 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00404 2026-04-02 cs.CV

The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation

第五届PVUW MeViS-Text挑战赛第一名:强多模态大语言模型与SAM3的结合用于指代视频对象分割

Xusheng He, Canyang Wu, Jinrong Zhang, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出一种无需微调的管道,结合强多模态大语言模型与SAM3,实现视频对象分割,取得PVUW 2026 MeViS-Text测试集第一名,得分为0.909064。

Comments 1st Place Solution for the 5th PVUW MeViS-Text Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00395 2026-04-02 cs.CV

Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge

通过跟踪增强提示推进复杂视频对象分割:第五届PVUW MOSE挑战赛第一名

Jinrong Zhang, Canyang Wu, Xusheng He, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, China(深圳市环区研究所)

AI总结 本文提出TEP方法,通过跟踪增强提示解决SAM3在处理小目标和语义主导对象时的不足,取得PVUW挑战赛优异成绩。

Comments 1st Place Solution for the 5th PVUW MOSE Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏