2608.05149 2026-08-06 cs.CV 新提交 CoCo-IR: Contextual Composed Image Retrieval CoCo-IR:上下文组合图像检索 Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui 机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google DeepMind(谷歌DeepMind) ; OpenAI 纠错 AI总结 针对现有图像检索系统无法处理多轮交互的局限,提出CoCo-IR任务,构建基于LMM的模型并开发自主数据引擎,在CIRCO和自建CoCo-IR基准上取得最优性能。 Comments ECCV 2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.04995 2026-08-06 cs.CV 新提交 Promptable Animal Pose Tracking Across Species 可跨物种提示式动物姿态跟踪 Le Li, Daniela Ivanova, Nicolas Pugeault AI总结 针对动物姿态跟踪的跨物种泛化与精度问题,提出有监督、无监督两种基于视觉基础模型的方法,在APTv2和TigDog数据集上实现了精度与泛化性的平衡,为动物保护应用提供实用方案。 Comments Accepted for presentation at the ECCV 2026 Workshop on CV4Ecology 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.04865 2026-08-06 cs.CV 新提交 Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen 超越帧的烹饪:厨房中的立体事件相机数据集 Chengming Feng, Hesam Araghi, Liming Zheng, Julien Dupeyroux, Xucong Zhang, Jan van Gemert, Nergis Tömen 机构 * Delft University of Technology(代尔夫特理工大学) ; STMicroelectronics(意法半导体) 纠错 AI总结 本文推出EventKitchen数据集,以第一人称视角从10名参与者在13个厨房中收集5.5小时的烹饪相关多传感器数据,训练基线模型完成动作识别等任务,为神经形态视觉提供新基准。 Comments Accepted at ECCV 2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.04642 2026-08-06 cs.CV 新提交 YOLO-PVC: 2D-to-3D Consolidation of Slice-wise Detections for Volumetric Liver Tumor Localization in MRI YOLO-PVC:用于MRI中体积肝肿瘤定位的切片式检测的2D到3D整合方法 Talha Waqas, Mounir Lahlouh, Kawther Taibouni, Mahnoor Waqas, Salar Ahmed, Sébastien Mulé, Yasmina Leroul-Chenoune 机构 * ESME Research Lab(ESME研究实验室) ; Université Paris-Est Créteil(巴黎东部克雷泰伊大学) ; LRE EPITA(EPITA LRE实验室) ; Institute of Space Technology(空间技术研究所) ; Henri Mondor University Hospital(亨利·蒙多大学医院) 纠错 AI总结 针对切片式2D目标检测器在体积数据中预测碎片化不稳定的问题,提出YOLO-PVC框架,通过几何整合提升肝脏肿瘤定位的3D IoU至0.710,优于多种基线方法。 Comments 14 pages, 2 figures, 4 tables. Accepted at AI4M3D Workshop, ECCV 2026 (Spotlight) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.04483 2026-08-06 cs.CV 新提交 Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles 并非所有冗余视觉标记都相同:通过标记角色分析视觉标记剪枝 Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim 机构 * Maum AI Inc.(Maum AI公司) 纠错 AI总结 本研究针对视觉-语言模型(VLMs)的视觉标记剪枝问题,通过EmbedLens分析标记角色,发现代表性剪枝方法存在标记角色偏差但与下游性能无直接关联,优化角色分配后表明保留非活跃标记可维持或提升性能,为剪枝方法优化提供了新视角。 Comments Accepted to ECCV 2026 workshop, UniWorld 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.04210 2026-08-06 cs.CV 新提交 PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images PADFormer:基于稀疏视角图像的姿态无关异常检测 Ruiqi Wang, Yiming Qian, Fenggen Yu, Yuxuan Lu, Dakuo Wang, Hao Zhang, Jing Huang 机构 * Amazon(亚马逊) ; Simon Fraser University(西蒙菲莎大学) ; Northeastern University(东北大学) 纠错 AI总结 针对现有姿态无关异常检测方法依赖3D重建的缺陷,提出PADFormer模型,利用ViT结合跨视图掩码重建等机制,在PAD基准及FSAD任务上实现最优性能,兼具效率与泛化性。 Comments Accepted to ECCV 2026 (oral) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图