Towards Streaming LiDAR Object Detection with Point Clouds as Egocentric Sequences
面向点云作为自车序列的流式LiDAR目标检测
AI总结 PFCF提出了一种混合检测器,结合极坐标处理和笛卡尔推理,实现低延迟高精度的LiDAR目标检测。
Comments Accepted to WACV 2026
期刊&会议
Winter Conference on Applications of Computer Vision · 会议 · Computer Vision
面向点云作为自车序列的流式LiDAR目标检测
AI总结 PFCF提出了一种混合检测器,结合极坐标处理和笛卡尔推理,实现低延迟高精度的LiDAR目标检测。
Comments Accepted to WACV 2026
DiRe:促进多样性的正则化方法用于数据集压缩
机构 * Department of Artificial Intelligence, Indian Institute of Technology Hyderabad(人工智能系,印度理工学院海得拉巴) ; Centre for Responsible AI, Wadhwani School of Data Science & AI, Indian Institute of Technology Madras(负责任人工智能中心,Wadhwani数据科学与人工智能学院,印度理工学院马德拉斯)
AI总结 DiRe通过引入余弦相似度和欧几里得距离的正则化方法,提升数据集压缩的多样性与泛化能力。
Comments Accepted at WACV 2026. v2: Optimized figure assets to reduce PDF size, no content changes
匹配语义相似但不相同的对象
机构 * Chiba University(千叶大学) ; Ricoh Company(理光公司)
AI总结 本研究提出语义增强加权方法,实现像素级别匹配语义相似但不相同的对象,适用于不同视角、类别差异和域转移等场景。
Comments WACV 2026
反向个性化
机构 * University of Trento(特伦托大学) ; University of Oulu(奥卢大学)
AI总结 本文提出反向个性化框架,通过条件扩散反向技术实现面部匿名化,支持属性可控的匿名化,平衡身份移除、属性保留和图像质量。
Comments WACV 2026
MEGA-PCC: 一种基于Mamba的高效联合几何与属性点云压缩方法
机构 * National Chung Cheng University, Taiwan(国立 Chung Cheng 大学) ; National Yang Ming Chiao Tung University, Taiwan(国立 Yang Ming Chiao Tung 大学)
AI总结 MEGA-PCC是一种基于Mamba的端到端点云压缩方法,通过联合编码几何和属性信息,实现高效压缩与数据驱动的比特率分配。
Comments Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026 (WACV 2026)
一种用于检测生成模型中记忆的新型度量方法
机构 * University of Catania(卡塔尼亚大学) ; University of Messina(梅西纳大学)
AI总结 本文提出DeepSSIM,一种用于检测生成模型中记忆的新型自监督度量方法,通过学习嵌入空间和结构保持增强,有效提升记忆检测性能。
Comments Accepted to WACV 2026
WiSE-OD:红外目标检测中鲁棒性基准测试
机构 * Laboratoire d’imagerie, de vision et d’intelligence artificielle (LIVIA)(图像、视觉与人工智能实验室) ; International Laboratory on Learning Systems (ILLS)(学习系统国际实验室) ; Dept. of Systems Engineering, ETS Montreal, Canada(系统工程系,蒙特利尔大学)
AI总结 WiSE-OD通过结合RGB零样本和红外微调权重,提升红外目标检测在分布偏移下的鲁棒性。
Comments WACV 2026: IEEE/CVF Winter Conf. on Applications of Computer Vision, Tucson, USA
SegMo:基于段落的文本到3D人体运动生成
机构 * University of Sheffield(谢菲尔德大学) ; University of Glasgow(格拉斯哥大学) ; Queen Mary University of London(伦敦大学Queen Mary)
AI总结 SegMo通过段落对齐实现文本与3D人体运动的精细生成与对齐,提升生成效果并拓展应用范围。
Comments The IEEE/CVF Winter Conference on Applications of Computer Vision 2026
ORCA:面向档案化海洋物种的对象识别与理解
机构 * Hong Kong University of Science and Technology(香港科技大学) ; University of Electronic Science and Technology of China(电子科学与技术大学) ; Indo Ocean Foundation Project(印度洋基金会项目)
AI总结 ORCA提出一个多模态基准数据集,用于提升海洋物种识别与理解的研究水平,通过细粒度视觉和文本注释推动领域内方法学进展。
Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026
MarineEval: 评估视觉-语言模型的海洋智能
机构 * Hong Kong University of Science and Technology(香港科技大学)
AI总结 MarineEval首次构建大规模海洋VLM数据集和基准,评估现有VLM在回答海洋领域问题上的能力与局限性。
Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026
DexAvatar: 基于手部和身体姿态先验的3D手语重建
机构 * Monash University(墨尔本大学)
AI总结 DexAvatar通过学习的3D手部和身体先验,实现了对野外单目手语视频中细粒度手部动作和身体运动的高精度重建,提升了手语姿态估计的性能。
Comments Accepted in WACV 2026
TrashDet: 为高效垃圾检测的迭代神经架构搜索
机构 * Department of Research Computing(研究计算系) ; University of Houston(休斯敦大学) ; Department of Engineering Technology(工程技术系)
AI总结 TrashDet通过迭代神经架构搜索在资源受限设备上实现高效垃圾检测,提供多种参数规模的检测器,显著提升精度与能效。
Comments 10 pages. The paper has been accepted by the WACV 2026 workshop
视点感知的多模态知识蒸馏用于多视图动作识别
机构 * Nagoya University(名古屋大学) ; Guardian Robot Project, R-IH, RIKEN(守护机器人项目,RIIH,理化学研究所) ; Lawrence Technological University(劳伦斯技术大学)
AI总结 ViCoKD通过视点感知的多模态知识蒸馏方法,在多视图动作识别中提升模型性能,有效解决视点不一致问题。
Comments IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026
AGENet: 适应性边缘感知测地距离学习用于少样本医学图像分割
机构 * University College London(伦敦大学学院)
AI总结 AGENet通过边缘感知测地距离学习,提升少样本医学图像分割的边界精度与计算效率。
Comments Accepted for publication in WACV 2026 (Round 2)
像真正的病理科医生一样诊断:一种以不确定性为核心的多分辨率多实例学习方法
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出UFC-MIL方法,通过多分辨率图像和不确定性校准,提升多实例学习的诊断可靠性。
Comments Accepted by IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026
SPOC: 视频中空间性推进的对象状态变化分割
AI总结 SPOC提出空间性推进的对象状态变化分割任务,通过伪标签和动态约束方法,解决视频中对象变化位置和速度的精确定位问题。
Comments Accepted at WACV 2026
基于点图的扩散模型用于一致的新型视角合成
机构 * Noah’s Ark, Huawei Paris Research Center(Noah’s Ark,华为巴黎研究中心) ; COSYS, Gustave Eiffel University(COSYS,格拉夫-埃菲尔大学) ; LASTIG, IGN-ENSG, Gustave Eiffel University(LASTIG,IGN-ENSG,格拉夫-埃菲尔大学)
AI总结 PointmapDiff通过利用点图作为条件信号,结合预训练的2D扩散模型,实现城市驾驶场景中一致的新型视角合成,并能生成高质量结果。
Comments WACV 2026. Project page: https://ntaquan0125.github.io/pointmap-conditioned-diffusion
多粒度文本引导图像融合用于多曝光和多聚焦场景
机构 * Xidian University(西安电子科技大学) ; Nanyang Technological University(新加坡国立大学) ; Xi’an University of Technology(西安理工大学)
AI总结 本文提出MTIF方法,通过多粒度文本描述和跨模态调节模块提升多曝光和多聚焦图像融合性能。
Comments Accepted to WACV 2026
milliMamba:基于双频毫米波雷达的镜面感知人体姿态估计方法
机构 * National Yang Ming Chiao Tung University ; University of Washington
AI总结 milliMamba通过双频毫米波雷达和多帧Mamba融合,实现镜面感知的人体姿态估计,提升鲁棒性和精度。
Comments Accepted at WACV 2026
多模态足球场景分析与掩码预训练
机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)
AI总结 本文提出了一种多模态架构,通过结合结构和视觉线索,有效推断足球场景中的球轨迹、状态和控制者,采用CropDrop策略提升模型鲁棒性。
Comments 10 pages, 2 figures. WACV 2026
brat: 用于脑部MRI分析的对齐多视图嵌入
机构 * Memorial Sloan Kettering Cancer Center(纪念斯隆凯特林癌症中心) ; University of Oxford(牛津大学) ; London School of Economics(伦敦经济学院)
AI总结 brat通过多视图嵌入方法提升脑MRI与临床报告的对齐能力,公开发布基础模型以改进医学影像分析性能。
Comments First round accept at WACV 2026
Geo3DVQA:基于航拍影像评估视觉-语言模型在三维地理空间推理中的表现
机构 * The University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所AIP)
AI总结 Geo3DVQA通过评估视觉-语言模型在三维地理空间推理中的表现,揭示了RGB影像在3D空间分析中的局限性,并展示了领域特定指令微调对模型性能的提升。
Comments Accepted at WACV 2026. 32 pages long including the appendix. Revision details are provided in the supplements
OW-Rep: 开放世界目标检测中的实例表示学习
机构 * KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; Agency for Defense Development(国防发展局)
AI总结 OW-Rep通过引入实例表示学习,提升开放世界目标检测中未知目标的检测精度和语义嵌入质量,增强下游任务表现。
Comments Accepted to WACV 2026. Our project website can be found at https://sunohlee.github.io/OW-Rep/
FocalComm: 重视困难实例的多智能体感知
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 FocalComm通过聚焦困难实例特征交换,提升多智能体协作感知中对行人等安全关键物体的检测性能。
Comments WACV 2026
否定对CLIP在医学影像中的影响:对比语言-图像预训练的局限性
机构 * Santa Clara University(圣克拉拉大学) ; University of Wyoming(怀俄明大学)
AI总结 研究探讨CLIP在医学影像中处理否定短语的局限性,并通过调优方法提升其检索准确性与可靠性。
Comments 10 pages, 7 figures, submitted to WACV Pixels to Patients Workshop
零shot分层植物分割:通过基础分割模型和文本到图像注意力
机构 * The University of Osaka(大阪大学) ; Phytometrics ; Nagoya University(名古屋大学)
AI总结 ZeroPlantSeg通过基础分割模型和文本到图像注意力实现零shot分层植物分割,有效提取植物个体,优于现有方法。
Comments WACV 2026 Accepted
通过Geo-Wasserstein散度进行3D细胞过分割校正
机构 * Columbia University(哥伦比亚大学) ; Princeton University(普林斯顿大学) ; University of California, San Francisco(旧金山大学)
AI总结 本文提出Geo-Wasserstein散度用于3D细胞过分割校正,结合几何和拓扑特征提升分割质量。
Comments Accepted to WACV 2026
DenseBEV:将BEV网格单元转换为3D对象
机构 * NMS Non-Maximum Suppression IoU Intersection-over-Union FoV Field of View mAP mean Average Precision NDS nuScenes detection score ATE Average Translation Error ASE Average Scale Error AOE Average Orientation Error AVE Average Velocity Error AAE Average Attribute Error LET Longitudinal Error Tolerant APL Average Precision Longitudinal APH Average Precision Heading LSS Lift, Splat, Shoot BEV Bird’s-Eye-View DenseBEV: Transforming BEV Grid Cells into 3D Objects(NMS非最大抑制IoU交并比FoV视野mAP均值平均精度NDSnuScenes检测得分ATE平均平移误差ASE平均尺度误差AOE平均方位误差AVE平均速度误差AAE平均属性误差LET纵向误差容忍APL纵向平均精度APH平均方位精度LSS抬升、投射、射击BEV鸟视图DenseBEV:将BEV网格单元转换为3D对象)
AI总结 DenseBEV通过直接使用BEV特征单元作为锚点,提出了一种高效且直观的多摄像头3D目标检测方法,提升了小目标检测性能。
Comments 15 pages, 8 figures, accepted by WACV 2026
通过动作交互:基于联合学习动作-交互潜在空间的牛群交互检测
机构 * Kobe University(神户大学) ; The University of Osaka(大阪大学)
AI总结 本文提出CattleAct方法,通过联合学习动作-交互潜在空间,实现高效检测牛群交互,提升智能畜牧业管理能力。
Comments Accepted to WACV 2026
看见即信仰(并预测):基于视觉语言模型的上下文感知多人类行为预测
机构 * Institute of Architecture of Application Systems, University of Stuttgart, Germany(应用系统建筑研究所,斯图加特大学,德国) ; Bosch Research, Germany(博世研究,德国)
AI总结 CAMP-VLM通过结合视觉语言模型与上下文特征,提升了多人类行为预测的准确性,其在预测精度上比基线模型高66.9%。
Comments Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026