arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Winter Conference on Applications of Computer Vision · 会议 · Computer Vision

2025-12-23 至 2025-12-23 共收录 5
2512.19528 2025-12-23 cs.CV

Multi-Modal Soccer Scene Analysis with Masked Pre-Training

多模态足球场景分析与掩码预训练

Marc Peral, Guillem Capellera, Luis Ferraz, Antonio Rubio, Antonio Agudo

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)

AI总结 本文提出了一种多模态架构,通过结合结构和视觉线索,有效推断足球场景中的球轨迹、状态和控制者,采用CropDrop策略提升模型鲁棒性。

Comments 10 pages, 2 figures. WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18679 2025-12-23 cs.CV cs.CL

brat: Aligned Multi-View Embeddings for Brain MRI Analysis

brat: 用于脑部MRI分析的对齐多视图嵌入

Maxime Kayser, Maksim Gridnev, Wanting Wang, Max Bain, Aneesh Rangnekar, Avijit Chatterjee, Aleksandr Petrov, Harini Veeraraghavan, Nathaniel C. Swinburne

机构 * Memorial Sloan Kettering Cancer Center(纪念斯隆凯特林癌症中心) University of Oxford(牛津大学) London School of Economics(伦敦经济学院)

AI总结 brat通过多视图嵌入方法提升脑MRI与临床报告的对齐能力,公开发布基础模型以改进医学影像分析性能。

Comments First round accept at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07276 2025-12-23 cs.CV

Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery

Geo3DVQA:基于航拍影像评估视觉-语言模型在三维地理空间推理中的表现

Mai Tsujimoto, Junjue Wang, Weihao Xuan, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP)

AI总结 Geo3DVQA通过评估视觉-语言模型在三维地理空间推理中的表现,揭示了RGB影像在3D空间分析中的局限性,并展示了领域特定指令微调对模型性能的提升。

Comments Accepted at WACV 2026. 32 pages long including the appendix. Revision details are provided in the supplements

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16073 2025-12-23 cs.CV cs.RO

OW-Rep: Open World Object Detection with Instance Representation Learning

OW-Rep: 开放世界目标检测中的实例表示学习

Sunoh Lee, Minsik Jeon, Jihong Min, Junwon Seo

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) Agency for Defense Development(国防发展局)

AI总结 OW-Rep通过引入实例表示学习,提升开放世界目标检测中未知目标的检测精度和语义嵌入质量,增强下游任务表现。

Comments Accepted to WACV 2026. Our project website can be found at https://sunohlee.github.io/OW-Rep/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13982 2025-12-23 cs.CV

FocalComm: Hard Instance-Aware Multi-Agent Perception

FocalComm: 重视困难实例的多智能体感知

Dereje Shenkut, Vijayakumar Bhagavatula

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 FocalComm通过聚焦困难实例特征交换,提升多智能体协作感知中对行人等安全关键物体的检测性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏