arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-03 至 2026-04-03 共收录 39
2604.02331 2026-04-03 cs.CV

EventHub: Data Factory for Generalizable Event-Based Stereo Networks without Active Sensors

EventHub:无需主动传感器的通用事件基立体网络数据工厂

Luca Bartolomei, Fabio Tosi, Matteo Poggi, Stefano Mattoccia, Guillermo Gallego

机构 * Advanced Research Center on Electronic System (ARCES)(电子系统高级研究中心 (ARCES)) TU Berlin, Robotics Institute Germany(柏林工业大学德国机器人研究所) Einstein Center Digital Future(爱因斯坦数字未来中心) SCIoI Excellence Cluster(SCIoI卓越集群)

AI总结 EventHub利用标准彩色图像生成代理标注和事件,无需主动传感器的地面真实标注,重新利用先进RGB立体模型处理事件数据,提升立体网络的泛化能力。

Comments CVPR 2026. Project Page: https://bartn8.github.io/eventhub/ Code: https://github.com/bartn8/eventhub

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02328 2026-04-03 cs.CV

Modulate-and-Map: Crossmodal Feature Mapping with Cross-View Modulation for 3D Anomaly Detection

调制与映射:用于3D异常检测的跨模态特征映射与跨视图调制

Alex Costanzino, Pierluigi Zama Ramirez, Giuseppe Lisanti, Luigi Di Stefano

机构 * CVLab, University of Bologna(博洛尼亚大学CVLab) Ca’ Foscari University of Venice(威尼斯大学)

AI总结 ModMap提出一种多视图多模态框架,通过跨模态特征映射和视图依赖关系建模,实现3D异常检测与分割,采用跨视图训练策略提升异常评分。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02252 2026-04-03 cs.CV

SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

SPAR:单次通过任意分辨率ViT用于开放词汇分割

Naomi Kombol, Ivan Martinović, Siniša Šegvić, Giorgos Tolias

AI总结 SPAR通过单次通过任意分辨率ViT实现高效高分辨率推理,提升开放词汇分割的mIoU性能,无需架构改动或像素级监督。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02162 2026-04-03 cs.CV

Beyond the Fold: Quantifying Split-Level Noise and the Case for Leave-One-Dataset-Out AU Evaluation

超越折叠:量化分层噪声及留一数据集-out AU评估的案例

Saurabh Hinduja, Gurmeet Kaur, Maneesh Bilalpur, Jeffrey Cohn, Shaun Canavan

机构 * CGI Technologies and Solutions Inc(CGI技术与解决方案公司) University of Pittsburgh(匹兹堡大学) University of South Florida(南佛罗里达大学)

AI总结 本文探讨了交叉验证中分层噪声的影响,发现其引入了可测量的随机方差,并通过留一数据集-out方法验证了跨数据集鲁棒性,指出交叉折叠验证的提升可能源于协议方差。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02093 2026-04-03 cs.CV

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样

Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang

机构 * Newcapec AI Research(新开普人工智能研究院) Fudan University(复旦大学) Tongji University(同济大学)

AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22193 2026-04-03 cs.CV

PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎

Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao

机构 * Peking University(北京大学) Tsinghua University(清华大学) BAAI(北京智源人工智能研究院) SJTU(上海交通大学) Eastern Institute of Technology(东方理工高等研究院) University of Cambridge(剑桥大学)

AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。

Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14870 2026-04-03 cs.CV eess.IV

HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering

HERBench:视频问答中多证据整合的基准

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本-古里安大学 INSIGHT 实验室) Ben-Gurion University of the Negev(本-古里安大学)

AI总结 HERBench通过要求至少三个非重叠视频片段线索,推动视频问答中多证据整合的研究,评估13种最新视频大语言模型,发现其准确率仅31-42%,揭示检索与融合两大瓶颈。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13714 2026-04-03 eess.IV cs.AI cs.CV cs.LG

DeDelayed: Deleting Remote Inference Delay via On-Device Correction

DeDelayed:通过设备端校正删除远程推断延迟

Dan Jacobellis, Mateen Ulhaq, Fabien Racapé, Hyomin Choi, Neeraja J. Yadwadkar

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) InterDigital

AI总结 本文提出DeDelayed系统,通过设备端与远程模型协同推断,降低视频处理延迟,提升实时视频分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02071 2026-04-03 cs.CV cs.AI cs.LG

Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection

挖掘实例导向的视觉-语言上下文以实现人-物交互检测

Soo Won Seo, KyungChae Lee, Hyungchan Cho, Taein Son, Nam Ik Cho, Jun Won Choi

机构 * Seoul National University(首尔国立大学) Hanyang University(汉阳大学)

AI总结 本文提出InCoM-Net框架,通过整合VLM提取的语义知识与实例特征,提升人-物交互检测的交互推理能力,实验表明其在HICO-DET和V-COCO基准上达到最优性能。

Comments Accepted to CVPR 2026. Code: https://github.com/nowuss/InCoM-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02032 2026-04-03 cs.CV cs.LG

IndoorCrowd: A Multi-Scene Dataset for Human Detection, Segmentation, and Tracking with an Automated Annotation Pipeline

IndoorCrowd: 一个用于人体检测、分割和跟踪的多场景数据集及自动化标注流水线

Sebastian-Ion Nae, Radu Moldoveanu, Alexandra Stefania Ghita, Adina Magda Florea

机构 * National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学国家科学技术大学) Expleo

AI总结 IndoorCrowd数据集通过多场景采集,提供人体检测、实例分割和多目标跟踪的基准,包含31个视频和自动化标注工具的评估结果,揭示了人群密度、尺度和遮挡对任务的影响。

Comments Accepted at Conference on Computer Vision and Pattern Recognition Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01966 2026-04-03 cs.CV cs.AI cs.RO

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01888 2026-04-03 cs.CV

Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters

低努力对抗攻击针对文本到图像安全过滤器

Ahmed B Mustafa, Zihan Ye, Yang Lu, Michael P Pound, Shreyank N Gowda

机构 * University of Nottingham(诺丁汉大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学) Xiamen University(厦门大学)

AI总结 研究揭示文本到图像模型易受低努力对抗攻击影响,通过提示策略绕过安全过滤,展示多种视觉对抗技术,揭示表面提示过滤与深层语义理解的差距,攻击成功率高达74.47%。

Comments Text-to-Image version of the Anyone can Jailbreak paper. Accepted in CVPR-W AIMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01791 2026-04-03 cs.CV

PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistency

PTC-Depth:基于姿态优化的单目深度估计与时间一致性

Leezy Han, Seunggyu Kim, Dongseok Shim, Hyeonbeom Lee

机构 * Ajou University(亚洲大学) Sony Creative AI Lab(索尼创意AI实验室)

AI总结 本文提出PTC-Depth框架,通过轮式里程计实现稳定深度估计,结合光流三角化估计相机姿态和稀疏深度,利用递归贝叶斯估计修正尺度,提升深度预测的准确性和一致性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01777 2026-04-03 cs.CV

GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agents

GardenDesigner: 通过一系列智能体编码美学原则以指导江南园林建设

Mengtian Li, Fan Yang, Ruixue Xiong, Yiyan Fan, Zhifeng Xie, Zeyu Wang

机构 * Shanghai University(上海大学) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出GardenDesigner框架,通过智能体链编码江南园林建设的美学原则,结合地形分布和道路生成代理,实现快速生成多样化且美观的江南园林。

Comments CVPR 2026, Project page: https://monad-cube.github.io/GardenDesigner

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01749 2026-04-03 cs.CV

Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding

超声-CLIP:面向超声图像-文本理解的语义感知对比预训练

Jiayun Jin, Haolong Chai, Xueying Huang, Xiaoqing Guo, Zengwei Zheng, Zhan Zhou, Junmei Wang, Xinyu Wang, Jie Liu, Binbin Zhou

机构 * Hangzhou City University(杭州城市大学) Hong Kong Baptist University(香港浸会大学) Zhejiang University(浙江大学) The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) City University of Hong Kong(香港城市大学)

AI总结 本文提出超声-CLIP,通过构建US-365K数据集和UDT知识框架,引入语义软标签和损失函数,提升超声图像与文本的语义对比学习效果,实现分类和检索的SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01666 2026-04-03 cs.CV

DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data

DynaVid: 通过合成运动数据学习生成高度动态视频

Wonjoon Jin, Jiyun Won, Janghyeok Han, Qi Dai, Chong Luo, Seung-Hwan Baek, Sunghyun Cho

机构 * POSTECH(浦项科技大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 DynaVid通过合成运动数据训练视频合成框架,解决动态视频生成中真实数据不足的问题,采用两阶段生成方法提升动态运动和摄像机运动的现实感与可控性。

Comments Accepted to CVPR 2026. Website: https://jinwonjoon.github.io/DynaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01634 2026-04-03 cs.LG cs.CL

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

CRIT: 基于图的自动数据合成以增强跨模态多跳推理

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(高丽大学计算机科学与工程系) Google DeepMind(谷歌DeepMind)

AI总结 CRIT通过图基自动管道生成复杂跨模态推理任务,提升多跳推理能力,实验表明先进模型在该任务上表现欠佳,训练于CRIT的模型在SPIQA等基准上显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01605 2026-04-03 cs.CV cs.RO

F3DGS: Federated 3D Gaussian Splatting for Decentralized Multi-Agent World Modeling

F3DGS:联邦3D高斯点云用于去中心化多智能体世界建模

Morui Zhu, Mohammad Dehghani Tezerjani, Mátyás Szántó, Márton Vaitkus, Song Fu, Qing Yang

机构 * University of North Texas(北德克萨斯大学) Budapest University of Technology and Economics(布达佩斯技术与经济大学)

AI总结 F3DGS通过联邦学习实现去中心化多智能体3D重建,利用共享几何框架和可见性感知聚合解决部分观测问题,实现分布式优化。

Comments Accepted to the CVPR 2026 SPAR-3D Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01600 2026-04-03 cs.AI

MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

MM-ReCoder:通过强化学习和自我校正推进图表到代码生成

Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo

机构 * Brown University(布朗大学) Amazon AGI(亚马逊AGI)

AI总结 MM-ReCoder通过强化学习和自我校正机制提升图表到代码生成能力,其两阶段多轮自我校正策略基于Group Relative Policy Optimization,提升代码准确性和可执行性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01586 2026-04-03 cs.CV cs.AI

SHOE: Semantic HOI Open-Vocabulary Evaluation Metric

SHOE:语义HOI开放词汇评估度量

Maja Noack, Qinqian Lei, Taipeng Tian, Bihan Dong, Robby T. Tan, Yixin Chen, John Young, Saijun Zhang, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

AI总结 本文提出SHOE评估框架,通过结合预测与真实HOI标签的语义相似性,改进开放词汇HOI检测的评估方法,实验表明其与人类判断一致率达85.73%。

Comments Accepted to GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01570 2026-04-03 cs.RO

Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior

通过可行动作邻域先验提升视觉-语言-动作微调

Haochen Niu, Kanyu Zhang, Shuyu Yin, Qinghai Guo, Peilin Liu, Fei Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies(华为技术有限公司)

AI总结 本文提出FAN引导正则化方法,通过调整模型输出分布以匹配FAN几何特性,提升VLA适应的样本效率和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01474 2026-04-03 cs.CV cs.LG

Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptation

一次优先,然后局部重新编程:一种高效替代黑盒服务模型适应的方法

Yunbei Zhang, Chengyi Cai, Feng Liu, Jihun Hamm

机构 * Tulane University(杜兰大学) University of Melbourne(墨尔本大学)

AI总结 本文提出AReS方法,通过一次交互预训练局部编码器,减少API调用成本,提升现代闭盒模型的适应性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01466 2026-04-03 cs.RO cs.CV cs.LG

Efficient Equivariant Transformer for Self-Driving Agent Modeling

高效等价变换器用于自动驾驶代理建模

Scott Xu, Dian Chen, Kelvin Wong, Chris Zhang, Kion Fallah, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

AI总结 本文提出DriveGATr,一种基于变换器的架构,通过多向量在2D投影几何代数中建模几何关系,实现SE(2)-等价性,无需显式成对相对位置编码,提升大规模场景下的效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01421 2026-04-03 cs.CV

EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

EgoFlow:基于梯度的流匹配用于第一人称6自由度物体运动生成

Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML(慕尼黑机器学习中心) ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出EgoFlow,通过多模态第一人称观察生成物理合理的物体运动轨迹,结合Mamba-Transformer-Perceiver架构和梯度引导推理,提升运动生成的准确性和物理真实性。

Comments CVPR 2026: https://abhi-rf.github.io/egoflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29272 2026-04-03 cs.CV cs.GR cs.RO

MaskAdapt: Learning Flexible Motion Adaptation via Mask-Invariant Prior for Physics-Based Characters

MaskAdapt:通过mask不变先验实现灵活的运动适应

Soomin Park, Eunseong Lee, Kwang Bin Lee, Sung-Hee Lee

机构 * KAIST(韩国科学技术院)

AI总结 MaskAdapt通过两阶段残差学习框架,结合随机身体部分遮挡和正则化项训练mask不变基础策略,实现物理基人物体的灵活运动适应,展示了运动合成和文本驱动部分目标跟踪的应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23711 2026-04-03 cs.CV

Mind the Hitch: Dynamic Calibration and Articulated Perception for Autonomous Trucks

注意挂钩:面向自动驾驶卡车的动态校准与关节感知

Morui Zhu, Yongqi Zhu, Song Fu, Qing Yang

机构 * University of North Texas(北德克萨斯大学)

AI总结 本文提出dCAP框架,通过动态校准和关节感知解决自动驾驶卡车中铰接结构带来的挑战,提升3D目标检测精度。

Comments CVPR 2026 camera-ready version (minor revision & supplementary included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17979 2026-04-03 cs.CV

AdaRadar: Rate Adaptive Spectral Compression for Radar-based Perception

AdaRadar: 基于雷达感知的自适应频谱压缩

Jinho Park, Se Young Chun, Mingoo Seok

机构 * Columbia University(哥伦比亚大学) Seoul National University(首尔国立大学)

AI总结 本文提出AdaRadar,通过自适应反馈机制实现雷达数据压缩,动态调整压缩比并利用零阶梯度近似,结合离散余弦变换和量化技术,实现超过100倍的特征尺寸缩减,性能损失仅约1%。

Comments Accepted to CVPR 2026. Project page: https://jp4327.github.io/adaradar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23791 2026-04-03 eess.IV cs.CV

FluoCLIP: Stain-Aware Focus Quality Assessment in Fluorescence Microscopy

FluoCLIP:荧光显微镜中考虑染色的聚焦质量评估

Hyejin Park, Jiwon Yoon, Sumin Park, Suree Kim, Sinae Jang, Eunsoo Lee, Dongmin Kang, Dongbo Min

机构 * Division of AI and Software, Ewha Womans University(梨花女子大学人工智能与软件学部) Bioimaging Data Curation Center (BDCC), Department of Life Science, Ewha Womans University(梨花女子大学生命科学系生物成像数据管理中心) Analytical Solution Team, Daesang Corporation(大象集团分析解决方案团队)

AI总结 本文提出FluoCLIP,一种两阶段视觉-语言框架,用于荧光显微镜中考虑染色的聚焦质量评估,通过显式建模染色依赖的聚焦行为,优于传统方法和最新视觉-语言基线。

Comments Accepted at CVPR 2026, Project Page: https://fluoclip.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20985 2026-04-03 cs.CV

EW-DETR: Evolving World Object Detection via Incremental Low-Rank DEtection TRansformer

EW-DETR: 通过增量低秩检测Transformer实现进化世界目标检测

Munish Monga, Vishal Chudasama, Pankaj Wasnik, C. V. Jawahar

机构 * Sony Research India(索尼印度研究院) IIIT Hyderabad(海德拉巴国际信息技术学院)

AI总结 本文提出EW-DETR框架,结合增量学习、领域自适应和未知检测,在无示例约束下实现进化世界目标检测,通过三个协同模块提升性能,实验表明其在Pascal系列和多天气基准上表现优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06393 2026-04-03 cs.IR

MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model

MuCo:多轮对比学习用于多模态嵌入模型

Geonmo Gu, Byeongho Heo, Jaemyung Yu, Jaehui Hwang, Taekyung Kim, Sangmin Lee, HeeJae Jun, Yoohoon Kang, Sangdoo Yun, Dongyoon Han

AI总结 本文提出MuCo,一种基于对话的多轮对比学习框架,通过多轮查询-目标对提升多模态嵌入模型的训练效率和表征一致性。

Comments CVPR 2026 camera-ready; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏