arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-06-09 至 2026-06-09 共收录 11
2606.09679 2026-06-09 cs.CV 新提交

SoccerNet 2026 Player-Centric Ball-Action Spotting:Retraining and Post-Processing Extensions to the FOOTPASS Baselines

SoccerNet 2026 以球员为中心的球类动作定位:FOOTPASS 基线的重训练与后处理扩展

Parthsarthi Rawat

机构 * GameChanger by Dick’s Sporting Goods(迪克体育用品的GameChanger)

AI总结 针对足球广播中八类动作的球员-动作-时间预测任务,在FOOTPASS基线上提出梯度检查点、GNN与DST融合、平方根频率类别加权和后处理流水线四项扩展,在测试集和挑战集上分别达到0.548和0.446的Macro F1。

Comments CVPR 2026 SoccerNet Player Centric Ball Action Spotting Challenge, Rank 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09273 2026-06-09 cs.CV 新提交

EditSSC: Toward Editable Semantic Occupancy Scenes with Unconditional Diffusion Models

EditSSC: 基于无条件扩散模型的可编辑语义占用场景

Fatima Balde, Raoul de Charette, Alexandre Boulch

机构 * Inria(法国国家信息与自动化研究所) Valeo.ai(法雷奥人工智能实验室)

AI总结 提出EditSSC方法,利用2D BEV表示和现成潜扩散网络实现3D语义场景生成与免训练编辑,在SemanticKITTI上优于现有3D专用基线。

Comments Accepted at CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08016 2026-06-09 cs.CV cs.AI cs.CL 新提交

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理

Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新研究院) Huawei Technologies Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)

AI总结 提出IEA对话式图像编辑代理,通过三阶段多任务训练学习操作参数化工具,实现可解释编辑轨迹,在像素距离和ROUGE-L指标上优于基线,用户研究中指令跟随和感知质量表现最佳。

Comments [CVPR 2026 Findings] Our data and code are released at https://github.com/OpenDFM/Image_Edit_Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24583 2026-06-09 cs.CV

Improving Vision-language Models with Perception-centric Process Reward Models

通过以感知为中心的过程奖励模型改进视觉-语言模型

Yingqian Min, Kun Zhou, Yifan Li, Yuhuan Wu, Han Peng, Yifan Du, Wayne Xin Zhao, Min Yang, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Bytedance(字节跳动) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Perceval模型,通过token级错误定位提升视觉-语言模型的推理能力,通过感知驱动的监督策略实现细粒度训练与推理优化,实验显示在多个领域基准上显著提升性能。

Comments 8 pages

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 33099-33109

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18493 2026-06-09 eess.IV cs.AI cs.CV 版本更新

SAGE: Shape-Adapting Gated Experts for Adaptive Histopathology Image Segmentation

SAGE:适应性组织病理图像分割的形状自适应门控专家

Gia Huy Thai, Hoang-Nguyen Vu, Anh-Minh Phan, Quang-Thinh Ly, Thi-Ngoc-Truc Nguyen, Nhat Ho

机构 * University of Science, VNU-HCM(越南国家大学科学学院) Trivita AI University of Technology, VNU-HCM(越南国家大学技术学院) Michigan State University, USA(美国密歇根州立大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 SAGE通过动态专家路由框架提升异构视觉网络中细胞形态变化的适应性,实现高精度分割与稳健泛化。

Comments Accepted to CVPR 2026 (Findings Track). Project Page: https://oxyzgiahuy.github.io/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24181 2026-06-09 cs.CV cs.AI 版本更新

A Mixed Diet Makes DINO An Omnivorous Vision Encoder

混合饮食使DINO成为杂食视觉编码器

Rishabh Kabra, Maks Ovsjanikov, Drew A. Hudson, Ye Xia, Skanda Koppula, Andre Araujo, Joao Carreira, Niloy J. Mitra

机构 * Google DeepMind(谷歌DeepMind) University College London(伦敦大学学院)

AI总结 针对DINOv2等预训练视觉编码器在不同视觉模态间特征对齐差的问题,提出杂食视觉编码器,通过后训练框架学习模态无关特征空间,实现跨模态鲁棒理解。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21172 2026-06-09 cs.AI cs.CV 版本更新

NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

NoRD: 一种无需推理的高数据效率视觉-语言-动作模型

Ishaan Rawal, Shubh Gupta, Yihan Hu, Wei Zhan

机构 * Applied Intuition Texas A&M University(德克萨斯大学A&M分校) UC Berkeley(伯克利加州大学)

AI总结 提出NoRD模型,通过无需推理标注和仅需<60%数据微调,结合Dr. GRPO算法克服难度偏差,实现与现有VLA模型相当的性能,显著降低数据与计算开销。

Comments Accepted to CVPR 2026. Code available at: https://github.com/Applied-Open-Source/nord

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15408 2026-06-09 cs.CV cs.AI cs.CL cs.LG 版本更新

CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation

CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成

Pablo Messina, Andrés Villa, Juan León Alcázar, Karen Sánchez, Carlos Hinojosa, Denis Parra, Álvaro Soto, Bernard Ghanem

机构 * Pontificia Universidad Católica de Chile(智利天主教大学) CENIA iHEALTH KAUST(科威特皇家科学与技术局)

AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。

Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20182 2026-06-09 cs.CV 版本更新

PEDRA: Evaluating the Realism of Pedestrian Dynamics in Video Generation

PEDRA: 评估视频生成中行人动态的真实性

Aaron Appelle, Jerome P. Lynch

机构 * Duke University(杜克大学)

AI总结 提出PEDRA评估协议,通过重建鸟瞰轨迹等方法,测试文本/图像到视频模型生成多行人交互场景的真实性,发现现有模型虽具备先验但存在行人合并消失等物理不一致问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18314 2026-06-09 cs.LG cs.AI cs.CV 版本更新

LoTUS: Large-Scale Machine Unlearning with a Taste of Uncertainty

LoTUS:带有不确定性风味的大规模机器遗忘

Christoforos N. Spartalis, Theodoros Semertzidis, Petros Daras, Efstratios Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) Centre for Research & Technology Hellas(希腊研究中心与技术中心) Archimedes/Athena RC(阿基米德/雅典娜研究中心)

AI总结 提出LoTUS方法,通过平滑预测概率至信息论界限来消除训练样本影响,避免从头重训练,在Transformer和ResNet18模型上超越现有方法,并引入RF-JSD指标用于实际评估。

Comments Accepted as a main conference paper at CVPR 2025 (https://cvpr.thecvf.com/virtual/2025/poster/33292)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08922 2026-06-09 cs.LG stat.ML 版本更新

The Mirrored Influence Hypothesis: Efficient Data Influence Estimation by Harnessing Forward Passes

镜像影响假说:利用前向传播的高效数据影响估计

Myeongseob Ko, Feiyang Kang, Weiyan Shi, Ming Jin, Zhou Yu, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) Columbia University(哥伦比亚大学)

AI总结 提出镜像影响假说,将训练数据对测试预测的影响转化为逆问题,通过测试样本梯度加训练样本前向传播高效估计数据影响,显著提升效率。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024

详情

展开后加载摘要…

URL PDF HTML 收藏