RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding
RoadBench: 一种用于道路损伤理解的视觉-语言基础模型和基准
AI总结 RoadBench通过整合视觉与文本信息,提出RoadCLIP模型,显著提升道路损伤识别性能,为基础设施监测提供新基准。
Comments Accepted by WACV 2026
期刊&会议
Winter Conference on Applications of Computer Vision · 会议 · Computer Vision
RoadBench: 一种用于道路损伤理解的视觉-语言基础模型和基准
AI总结 RoadBench通过整合视觉与文本信息,提出RoadCLIP模型,显著提升道路损伤识别性能,为基础设施监测提供新基准。
Comments Accepted by WACV 2026
INRetouch: 基于上下文的隐式神经表示用于摄影修图
机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)
AI总结 INRetouch通过基于上下文的隐式神经表示,实现高保真度的摄影修图,并提升图像重建性能。
Comments Accepted by WACV 2026
当什么发生时:学习视频中事件的时间顺序
机构 * Seoul National University(首尔国立大学) ; Imperial College London(帝国理工学院伦敦分校)
AI总结 本文提出MECOT方法,通过事件级描述训练和思维链提示提升视频模型对事件时间顺序的理解能力。
Comments WACV 2026
超越真实权重:用于稳定量化 的超复数表示
机构 * Artificial Intelligence Department, RobotBulls Labs(机器人bulls实验室人工智能部门) ; Machine Intelligence Lab (MILab), North South University(北南大学机器智能实验室)
AI总结 本文提出了一种基于超复数乘法的渐进式重新参数化策略,用于压缩多模态语言模型,实现参数和计算量的显著减少,同时保持模型性能。
Comments Accepted in Winter Conference on Applications of Computer Vision (WACV) 2026
SDT-6D: 全稀疏深度-变换器用于工业多视角堆叠取料的端到端6D姿态估计
机构 * Institute for Applications of Machine Learning and Intelligent Systems(机器学习与智能系统应用研究所) ; University of Applied Science Munich(慕尼黑应用科学大学)
AI总结 SDT-6D提出了一种基于稀疏深度-变换器的端到端6D姿态估计方法,通过分阶段热图机制和密度感知稀疏变换器块,实现高分辨率下的高效姿态预测。
Comments Accepted to WACV 2026. Preprint version
逐层激活范数最小化提升联邦学习中的泛化能力
AI总结 通过引入'平坦性'约束的优化方法,该研究在联邦学习中最小化逐层激活范数以提升模型泛化能力,实现了新的性能突破。
Comments Accepted to WACV 2024
CVP:基于中央-外围视觉的多模态模型用于空间推理
机构 * UC San Diego(圣迭戈大学) ; Lambda, Inc(Lambda公司)
AI总结 CVP通过结合中央视觉和外围视觉的启发,提出了一种多模态模型,以提升复杂3D环境的空间推理能力。
Comments Accepted to WACV 2026
利用物体接地提升时间敏感视频理解
机构 * Intel(英特尔公司)
AI总结 本文提出 GO-Tokenizer 以提升视频大型语言模型的时间敏感视频理解能力,通过实时编码紧凑的物体信息,提高模型性能并减少噪声影响。
Comments Accepted to WACV 2026
MuSACo: 多模态主体特定选择与适应用于带有协同训练的表情识别
机构 * LIVIA, Dept. of Systems Engineering, ÉTS Montreal(LIVIA,系统工程系,蒙特利尔ÉTS) ; École Polytechnique, Palaiseau(巴黎政治学院,Palaiseau) ; Centre INRIA d’Université Côte d’Azur, Sophia Antipolis(法国阿尔卑斯大学INRIA中心,Sophia Antipolis)
AI总结 MuSACo通过多模态协同训练方法提升主体特定表情识别的准确性和鲁棒性,适用于数字健康中的个性化评估。
Comments WACV 2026
GorillaWatch: 一种用于野外大猩猩重识别与种群监测的自动化系统
机构 * Hasso Plattner Institute(哈索普拉特纳研究所) ; Conservation X Labs(保护X实验室) ; Sabine Plattner African Charities(萨宾·普拉特纳非洲慈善机构)
AI总结 GorillaWatch通过引入三个新数据集和端到端流程,实现了野外大猩猩的自动化重识别与种群监测,结合自监督预训练和可微分适应技术提升模型有效性。
Comments Accepted at WACV 2026
ControlVP: 交互式几何校正AI生成图像以保持一致的消失点
机构 * The University of Tokyo(东京大学)
AI总结 ControlVP通过结合建筑轮廓的结构指导和几何约束,校正AI生成图像中的消失点不一致,提升空间结构真实性。
Comments Accepted to WACV 2026, 8 pages, supplementary included. Dataset and code: https://github.com/RyotaOkumura/ControlVP
迈向可靠的测试时适应:风格不变性作为正确性的似然性
AI总结 SICL通过利用风格不变性实现鲁棒的不确定性估计,有效降低校准误差,提升测试时适应的可靠性。
Comments Accepted to WACV 2026
逻辑增强的概念学习模型:LogicCBMs
机构 * Indian Institute of Technology, Hyderabad(印度海得拉巴印度理工学院) ; Microsoft Research(微软研究院)
AI总结 LogicCBMs通过引入命题逻辑模块,增强概念学习模型的逻辑运算能力,提升模型的表达性和可解释性,实验证明其在准确性与可解释性上的优势。
Comments 18 pages, 19 figures, WACV 2026
STRinGS: 选择性文本细化在高斯点云中
机构 * CVIT, IIIT Hyderabad, India(计算机视觉研究所,印度海得拉巴印度理工学院)
AI总结 STRinGS提出了一种文本感知的选性细化框架,通过分离文本和非文本区域并优化全场景,提升3DGS重建中文本的清晰度和可读性,同时引入OCR字符错误率评估和STRinGS-360数据集。
Comments Accepted to WACV 2026. Project Page, see https://STRinGS-official.github.io
边界与反射的力量:利用金字塔视觉Transformer与透明提示进行语义透明物体分割
AI总结 本文提出TransCues框架,通过结合边界和反射特征增强模块,提升透明物体分割性能,在多个基准数据集上取得显著提升。
Comments Accepted to WACV 2026
通过条件似然实现通用和领域特定的生成图像零样本检测
AI总结 CLIDE是一种基于条件似然的新型零样本图像检测方法,通过计算真实图像的似然实现对不同领域图像的适应,展现出在通用和领域特定任务中的优越性能。
Comments 8 pages, 6 figures, accepted to WACV 2026
Splannequin: 通过双检测溅射实现单目人偶挑战视频的冻结3D场景
机构 * National Yang Ming Chiao Tung University ; The Ohio State University
AI总结 Splannequin通过双检测溅射技术,提升单目人偶挑战视频冻结3D场景的视觉质量,实现高保真用户可控的冻结时间渲染。
Comments WACV 2026. Project page: https://chien90190.github.io/splannequin/
DCText: 通过分而治之策略实现视觉文本生成的调度注意力遮罩
AI总结 DCText通过分而治之策略和注意力遮罩技术,实现高效视觉文本生成,提升长文本和多文本处理能力,同时保持图像质量和生成效率。
Comments Accepted to WACV 2026
基于图像回归的多模态大语言模型微调中的语言整合
机构 * Samsung Israel R&D Center(三星以色列研发中心)
AI总结 本文提出RvTC方法,通过灵活的区间法替代传统词汇受限分类,提升多模态大语言模型在图像回归任务中的性能。
Comments WACV 2026
利用正则化的3D扩散模型(R3DM)进行MRI重建
机构 * IAS-8 ; INM-4 Forschungszentrum Jülich(INM-4 研究中心) ; RWTH Aachen University(亚琛工业大学)
AI总结 本文提出了一种基于正则化3D扩散模型的MRI重建方法,通过结合优化方法提升图像质量与保真度,实验表明其在欠采样数据下的重建性能优于现有方法。
Comments Accepted to WACV 2025,17 pages, 8 figures
EmojiDiff: 高精度面部表情控制与高保真身份保持在肖像生成中
机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)
AI总结 EmojiDiff通过解耦训练和微调方法,实现了高精度面部表情控制与高保真身份保持的端到端肖像生成解决方案。
Comments accepted by WACV 2026
基于图像的语义伪LiDAR点生成用于3D目标检测
机构 * CSE, Korea University(韩国大学计算机科学与工程系) ; LG Innotek ; Waymo Research(Waymo研究院)
AI总结 ImagePG通过利用图像特征生成密集且语义丰富的3D点,提升自动驾驶中对小目标和远距离目标的检测性能。
Comments WACV 2026
道路旁单目3D检测受2D检测启发
机构 * Zhejiang University(浙江大学) ; Zhejiang Lab(浙江实验室) ; University of Macau(澳门大学) ; Institute of Collaborative Innovation(协同创新研究院)
AI总结 本文提出Pro3D,通过利用2D检测作为提示,提升道路旁单目3D检测的性能,实现更精确的3D定位。
Comments Accepted by WACV 2026
通过自动质量引导的自训练提升无监督视频实例分割
机构 * Technical University of Denmark(丹麦技术大学)
AI总结 AutoQ-VIS通过质量引导的自训练方法,在无需人工标注的情况下实现了无监督视频实例分割的最新性能。
Comments Accepted to WACV 2026. arXiv admin note: substantial text overlap with arXiv:2508.19808
CADE: 基于集成的持续弱监督视频异常检测
机构 * KDDI Research, Inc.(KDDI研究公司)
AI总结 CADE通过结合持续学习和弱监督方法,解决视频异常检测中的数据域变化和遗忘问题,提升检测性能。
Comments Accepted to WACV 2026
FedSCAl: 利用服务器与客户端对齐实现无监督联邦源域适应
机构 * Indian Institute of Science(印度科学研究院)
AI总结 FedSCAl通过引入服务器-客户端对齐机制,有效缓解联邦源域适应中的客户端漂移问题,提升伪标签准确性并优于现有方法。
Comments Accepted to Winter Conference on Applications of Computer Vision (WACV) 2026, Round 1
TriaGS: 可微三角化引导的几何一致性用于3D高斯点扩散
机构 * VinUniversity Ha Noi, Vietnam(越南河内Vin大学) ; University of Arkansas Fayetteville(阿肯色大学弗拉特维尔分校)
AI总结 TriaGS通过约束多视角三角化提升3D高斯点扩散的几何一致性,实现高保真表面重建。
Comments 10 pages
Journal ref WACV 2026
高斯摆动:基于表面的使用3D高斯的气动模拟框架
机构 * UC San Diego(UC圣迭戈大学) ; Princeton University(普林斯顿大学)
AI总结 本文提出Gaussian Swaying框架,通过3D高斯连续建模表面,实现高效且细致的气动模拟,适用于视觉和图形中的真实感渲染。
Comments Accepted to WACV 2026
类内概率嵌入用于视觉-语言模型中的不确定性估计
机构 * Queensland University of Technology(昆士兰理工大学)
AI总结 本研究提出一种无需训练的后处理方法,通过类内概率嵌入提升视觉-语言模型的不确定性估计,有效检测错误预测。
Comments Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026
极端不可见人脸检测
AI总结 本文提出了一种基于热图的极端不可见人脸检测方法,通过上下文线索高效预测超出画面区域的人脸位置,优于生成方法。
Comments Accepted by WACV 2026, project page: https://charliesong1999.github.io/exaft_web/