arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-27 至 2026-05-27 共收录 22
2605.27304 2026-05-27 cs.CV

PlayClass: Automated Play Behaviour Classification in Poultry

PlayClass: 家禽自动玩耍行为分类

Prince Ravi Leow, Neil Scheidwasser, Rebecca Oscarsson, Per Jensen, Samir Bhatt, David Alejandro Duchêne

机构 * Section for Health Data Science & AI, University of Copenhagen(哥本哈根大学健康数据科学与人工智能部门) AVIAN Behaviour Genomics and Physiology Group, Linköping University(林雪平大学鸟类行为基因组学与生理学组) Department of Infectious Disease Epidemiology, Imperial College London(伦敦帝国学院传染病流行病学系)

AI总结 提出PlayClass流水线,利用SAM 3长时跟踪和V-JEPA 2.1基础模型,从俯拍视频中自动分类家禽玩耍行为,达到77.0宏平均F1。

Comments Accepted at CV4Animals Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27235 2026-05-27 cs.CV

MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

MRT:用于大规模分层图像生成与编辑的掩码区域变换器

Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan

机构 * Canva Research(Canva研究院)

AI总结 提出MRT,一个200亿参数的掩码区域扩散模型,通过统一文本到层、图像到层和层到层任务,并引入溢出感知画布层,实现高效的多层透明图像生成与编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27020 2026-05-27 cs.CV cs.AI

Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models

黑盒成员推断攻击:针对图像生成模型的预训练数据

Tao Qi, Huili Wang, Yuanhong Huang, Wendan Wang, Lianchao Zhao, Jinrui Wang, Zichen Qin, Shangguang Wang, Yongfeng Huang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 提出一种基于跨模态数据扰动的黑盒成员推断攻击框架SD-MIA,通过分析扩散模型对目标图像和扰动文本指令的去噪过程,有效检测预训练数据中的成员关系。

Comments 13 pages, 9 figures; CVPR 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26879 2026-05-27 cs.CV

Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videos

通过对齐单目视频中的高阶时间动态恢复自然人体运动

Dingkun Wei, Zehong Shen, Yan Xia, Georgios Pavlakos, Yujun Shen, Xiaowei Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出HTD-Refine框架,利用PVA-Net估计的高阶时间动态(速度和加速度)优化全局轨迹,恢复自然人体运动。

Comments 13 pages, 6 figures. Accepted as an Oral presentation and Best Paper Candidate at CVPR 2026. Project page: https://zju3dv.github.io/htd-refine/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24456 2026-05-27 cs.CV

EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

EgoProx: 在认知层级上评估多模态大语言模型的自我中心3D邻近推理能力

Jinzhao Li, Yinuo Chen, Dongxu Piao, Panwang Pan, Yifan Yu, Dong Wang, Honglei Yan, Liang Yue, Shaofei Wang, Yixin Chen, Siyuan Huang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) ByteDance(字节跳动) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

AI总结 提出EgoProx基准,通过认知链任务和基于智能体的数据引擎,评估多模态大语言模型在自我中心3D邻近推理中的表现,发现模型虽具备空间知识但难以有效利用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26693 2026-05-27 cs.LG cs.AI stat.ML

Model Merging on Loss Landscape: A Geometry Perspective

损失景观上的模型合并:几何视角

Juanwu Lu, Anand Bhaskar, Brian Axelrod, Ekaterina Tolstaya, Tristan Emrich

机构 * Purdue University(普渡大学) Waymo LLC(Waymo公司)

AI总结 提出EpiMer框架,将模型合并视为黎曼流形上的Fréchet均值,利用任务向量张成的低秩子空间和期望Hessian度量,理论证明曲率感知合并优于平坦几何方法,并在八个图像分类任务上验证了性能提升。

Comments CVPR 2026 Findings Track. 18 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26636 2026-05-27 cs.CV cs.AI

JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search

JetViT: 高效高分辨率视觉Transformer与训练后注意力搜索

Dongyun Zou, Zhuoyang Zhang, Junyu Chen, Wenkun He, Qinhe Peng, Hanrong Ye, Yao Lu, Hongxu Yin, Yu Wang, Song Han, Han Cai

机构 * MIT(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) NVIDIA(NVIDIA公司) Physical Intelligence(物理智能)

AI总结 提出JetViT混合架构视觉Transformer,通过训练后注意力搜索将预训练全注意力ViT转换为高效混合注意力变体,在高分辨率图像上实现更高推理效率且不损失精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26538 2026-05-27 cs.CV

Scheduled Style Injection: Expanding the Style-Content Pareto Frontier in Training-Free Diffusion-based Style Transfer

调度式风格注入:在免训练扩散风格迁移中扩展风格-内容帕累托前沿

Amey Sunil Kulkarni

机构 * Independent Researcher(独立研究者)

AI总结 通过系统探索层、时间步和ControlNet几何条件四个维度的调度,发现递减调度(浅层和早期时间步强结构注入)优于递增调度,且余弦和平方根时间步调度优于线性,结合近乎独立的gamma调度与ControlNet条件可扩展帕累托前沿,在ArtFID上相对提升6.1%。

Comments Accepted to CVPR NTIRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26353 2026-05-27 cs.CV cs.AI cs.LG

Personalized Generative Models for Contextual Debiasing

用于上下文去偏的个性化生成模型

Xinran Liang, Esin Tureci, Prachi Sinha, Ye Zhu, Vikram V. Ramaswamy, Olga Russakovsky

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) LIX, CNRS, École Polytechnique(巴黎政治学院LIX研究所,法国国家科学研究中心)

AI总结 提出DecoupleGen方法,利用个性化文本到图像扩散模型生成罕见上下文图像,作为训练增强以缓解视觉识别中的上下文偏差。

Comments CVPR 2026 Workshop on Synthetic Data for Computer Vision and Generative Models for Computer Vision. Code available at https://github.com/princetonvisualai/DecoupleGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26273 2026-05-27 cs.CV

Frequency-Guided Fusion For RGB-Thermal Semantic Segmentation

频率引导的RGB-热红外语义分割融合

İsmail Emre Canıtez, Özgür Erkent

机构 * Hacettepe University(哈切特佩大学)

AI总结 提出一种基于双ConvNeXt V2骨干网络的多模态融合架构,通过频率分解和置信门控残差机制融合RGB与热红外特征,在MFNet和PST900上以较低参数量实现先进性能。

Comments 9 pages, 7 figures, To be Presented at Perception Beyond the Visible Spectrum workshop series (IEEE PBVS) at CVPR, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26241 2026-05-27 cs.CV

RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation

RoMo:用于人体运动生成的大规模、丰富组织的数据集和语义分类体系

Jiahao Zhang, Joseph Liu, Young-Yoon Lee, Seonghyeon Moon, Victor Zordan, Guy Tevet, Karen Liu, Stephen Gould, Oren Jacob, Haomiao Jiang, Mubbasir Kapadia, Yizhak Ben-Shabat

机构 * Australian National University(澳大利亚国立大学) Roblox Stanford University(斯坦福大学) Rutgers University(罗格斯大学)

AI总结 提出RoMo数据集,通过分类感知过滤流水线确保质量,并采用三级语义分类体系组织数据,使训练模型在保真度和多样性上达到最优,同时提升对复杂文本提示的理解。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26155 2026-05-27 cs.RO cs.AI cs.LG

When Does Adaptive Guidance Help? Belief-Aware Privileged Distillation for Autonomous Driving Under Partial Observability

自适应引导何时有帮助?部分可观测条件下自动驾驶的信念感知特权蒸馏

Mehmet Haklidir

机构 * TUBITAK BILGEM Artificial Intelligence Institute(土耳其TUBITAK BILGEM人工智能研究所)

AI总结 本文提出信念感知GSAC(BA-GSAC),通过集成分歧动态调节蒸馏系数,系统研究自适应引导在部分可观测自动驾驶中的有效性,发现严重遮挡下系数过早崩溃,并揭示可观测性盲区问题。

Comments 9 pages, 3 figures, 7 tables. Accepted at CVPR 2026 Workshop on Autonomous Driving (WAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26103 2026-05-27 cs.CV

Global Structure-from-Motion Meets Feedforward Reconstruction

全局运动恢复结构与前馈重建的结合

Linfei Pan, Johannes Schönberger, Marc Pollefeys

机构 * ETH Zurich(苏黎世联邦理工学院) Meta Reality Labs(Meta现实实验室) Microsoft(微软公司)

AI总结 提出一种结合经典SfM和前馈重建优势的新流水线,在多种场景下实现最先进的重建结果。

Comments CVPR 2026, Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25570 2026-05-27 cs.CV

From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimation

从对比到一致性:重新思考基于事件的连续时光流估计

Rui Hu, Song Wu, Wen Yang, Jinjian Wu

机构 * Xidian University(西安电子科技大学)

AI总结 提出一种基于时空结构一致性(STSC)的混合监督框架,结合双向互补多尺度架构和课程引导混合训练策略,在连续时间和标准光流估计中达到最先进性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07669 2026-05-27 cs.CV

SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels

SRL-CLIP: 通过结构化语义角色标签实现高效的CLIP视频适配

Darshan Singh, Zeeshan Khan, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad(IIIT海得拉巴计算机视觉研究所) Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所、巴黎综合理工学院、国家科学研究中心、巴黎高等研究大学)

AI总结 本文提出SRL-CLIP,利用结构化语义角色标签(SRL)生成规则化字幕,仅用23k视频-字幕对进行对比微调,即可高效适配CLIP用于通用视频理解,在零样本文本-视频检索上性能优于参数多4-8倍、数据多6000倍的模型。

Comments Accepted to the CV4Smalls Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00648 2026-05-27 cs.CV

DirectFisheye-GS: Enabling Native Fisheye Input in Gaussian Splatting with Cross-View Joint Optimization

DirectFisheye-GS: 在三维高斯泼溅中通过跨视图联合优化实现原生鱼眼输入

Zhengxian Yang, Fei Xie, Xutao Xue, Rui Zhang, Taicheng Huang, Yang Liu, Mengqi Ji, Tao Yu

机构 * BNRist, Tsinghua University(北京理工大学,清华大学) Beihang University(北航) JD.com, Beijing, China(京东(北京,中国)) Shanghai AI Lab(上海人工智能实验室)

AI总结 针对鱼眼相机输入导致的信息丢失和细节模糊问题,提出将鱼眼相机模型集成到3DGS框架中,并引入基于特征重叠的跨视图联合优化策略,实现无需预处理的原生鱼眼图像训练,提升重建质量。

Comments CVPR 2026 Highlight; Fix NSFC ID

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19206 2026-05-27 cs.CV

GS-CLIP: Zero-shot 3D Anomaly Detection by Geometry-Aware Prompt and Synergistic View Representation Learning

GS-CLIP: 基于几何感知提示与协同视图表示学习的零样本3D异常检测

Zehao Deng, An Liu, Yan Wang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 提出GS-CLIP框架,通过几何感知提示和协同视图表示学习,在零样本设置下有效检测3D点云中的几何异常。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15283 2026-05-27 cs.CV cs.GR

LuxRemix: Lighting Decomposition and Remixing for Indoor Scenes

LuxRemix: 室内场景的光照分解与重新混合

Ruofan Liang, Norman Müller, Ethan Weber, Duncan Zauss, Nandita Vijaykumar, Peter Kontschieder, Christian Richardt

机构 * Meta Reality Labs(Meta现实实验室) University of Toronto(多伦多大学)

AI总结 提出一种基于图像的光照分解模型,从多视图场景捕获中分解室内光照为独立光源,并通过多视图光照协调集成到可重光照的3D高斯溅射表示中,实现交互式光源编辑。

Comments CVPR 2026. Project page: https://luxremix.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07996 2026-05-27 cs.CV

Structured Relational Reasoning for Group Activity Assessment

结构化关系推理用于群体活动评估

Thinesh Thiyakesan Ponbagavathi, Chengzheng Yang, Alina Roitberg

机构 * University of Stuttgart(斯图加特大学) University of Hildesheim(希尔德斯海姆大学)

AI总结 提出ProGraD框架,利用冻结视觉基础模型和轻量级GroupContext Transformer,通过结构化关系推理在单次前向传播中联合推断群体位置、成员关系和活动,仅用10M参数即在Cafe和Social-CAD基准上取得最优性能。

Comments Accepted to CVPR 2026 Workshop (SAUAFG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16942 2026-05-27 cs.CV cs.LG

Efficient All-Pairs Correlation Volume Sampling for Optical Flow Estimation

高效的全对相关性体素采样用于光流估计

Karlis Martins Briedis, Markus Gross, Christopher Schroers

机构 * DisneyResearch|Studios(迪士尼研究与工作室) ETH Zürich(苏黎世联邦理工学院)

AI总结 提出一种内存和计算高效的算法,实现全对相关性体素采样的精确数学运算,在保持低内存占用的同时显著提升速度,并应用于高分辨率光流估计达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07853 2026-05-27 cs.CV

V2V3D: View-to-View Denoised 3D Reconstruction for Light-Field Microscopy

V2V3D:用于光场显微镜的视图到视图去噪三维重建

Jiayin Zhao, Zhenqi Fu, Tao Yu, Hui Qiao

机构 * Tsinghua University, Beijing 100084, China(清华大学,北京100084,中国) Shanghai AI Laboratory, China(上海人工智能实验室,中国)

AI总结 提出无监督视图到视图框架V2V3D,联合优化图像去噪和三维重建,利用噪声独立性实现噪声到噪声去噪,并设计基于波动光学的特征对齐技术恢复高频细节,在效率和性能上超越现有方法。

Comments CVPR 2025; New version: Fix NSFC ID

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14359 2026-05-27 cs.CV

ImViD: Immersive Volumetric Videos for Enhanced VR Engagement

ImViD:用于增强VR沉浸感的沉浸式体积视频

Zhengxian Yang, Shi Pan, Shengqi Wang, Haoxiang Wang, Li Lin, Guanjun Li, Zhengqi Wen, Borong Lin, Jianhua Tao, Tao Yu

机构 * Tsinghua University(清华大学) Migu Beijing Research Institute(中国移动北京研究院) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所)

AI总结 提出ImViD多视角多模态数据集,支持移动中捕获完整场景,为6自由度多模态沉浸式VR体验提供基准和重建管线。

Comments CVPR 2025 Highlight; Fix NSFC ID

详情

展开后加载摘要…

URL PDF HTML 收藏