arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Winter Conference on Applications of Computer Vision · 会议 · Computer Vision

共收录 2109
2507.17353 2025-12-11 cs.CE

RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding

RoadBench: 一种用于道路损伤理解的视觉-语言基础模型和基准

Xi Xiao, Yunbei Zhang, Janet Wang, Lin Zhao, Yuxiang Wei, Hengjia Li, Yanshu Li, Xinyuan Song, Xiao Wang, Swalpa Kumar Roy, Hao Xu, Tianyang Wang

AI总结 RoadBench通过整合视觉与文本信息,提出RoadCLIP模型,显著提升道路损伤识别性能,为基础设施监测提供新基准。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03848 2025-12-11 eess.IV cs.CV

INRetouch: Context Aware Implicit Neural Representation for Photography Retouching

INRetouch: 基于上下文的隐式神经表示用于摄影修图

Omar Elezabi, Marcos V. Conde, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

AI总结 INRetouch通过基于上下文的隐式神经表示,实现高保真度的摄影修图,并提升图像重建性能。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08979 2025-12-11 cs.CV cs.AI

What Happens When: Learning Temporal Orders of Events in Videos

当什么发生时:学习视频中事件的时间顺序

Daechul Ahn, Yura Choi, Hyeonbeom Choi, Seongwon Cho, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) Imperial College London(帝国理工学院伦敦分校)

AI总结 本文提出MECOT方法,通过事件级描述训练和思维链提示提升视频模型对事件时间顺序的理解能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08524 2025-12-10 cs.CV cs.CL

Beyond Real Weights: Hypercomplex Representations for Stable Quantization

超越真实权重:用于稳定量化 的超复数表示

Jawad Ibn Ahad, Maisha Rahman, Amrijit Biswas, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman

机构 * Artificial Intelligence Department, RobotBulls Labs(机器人bulls实验室人工智能部门) Machine Intelligence Lab (MILab), North South University(北南大学机器智能实验室)

AI总结 本文提出了一种基于超复数乘法的渐进式重新参数化策略,用于压缩多模态语言模型,实现参数和计算量的显著减少,同时保持模型性能。

Comments Accepted in Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08430 2025-12-10 cs.CV cs.RO

SDT-6D: Fully Sparse Depth-Transformer for Staged End-to-End 6D Pose Estimation in Industrial Multi-View Bin Picking

SDT-6D: 全稀疏深度-变换器用于工业多视角堆叠取料的端到端6D姿态估计

Nico Leuze, Maximilian Hoh, Samed Doğan, Nicolas R. -Peña, Alfred Schoettl

机构 * Institute for Applications of Machine Learning and Intelligent Systems(机器学习与智能系统应用研究所) University of Applied Science Munich(慕尼黑应用科学大学)

AI总结 SDT-6D提出了一种基于稀疏深度-变换器的端到端6D姿态估计方法,通过分阶段热图机制和密度感知稀疏变换器块,实现高分辨率下的高效姿态预测。

Comments Accepted to WACV 2026. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08314 2025-12-10 cs.LG

Minimizing Layerwise Activation Norm Improves Generalization in Federated Learning

逐层激活范数最小化提升联邦学习中的泛化能力

M Yashwanth, Gaurav Kumar Nayak, Harsh Rangwani, Arya Singh, R. Venkatesh Babu, Anirban Chakraborty

AI总结 通过引入'平坦性'约束的优化方法,该研究在联邦学习中最小化逐层激活范数以提升模型泛化能力,实现了新的性能突破。

Comments Accepted to WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08135 2025-12-10 cs.CV

CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning

CVP:基于中央-外围视觉的多模态模型用于空间推理

Zeyuan Chen, Xiang Zhang, Haiyang Xu, Jianwen Xie, Zhuowen Tu

机构 * UC San Diego(圣迭戈大学) Lambda, Inc(Lambda公司)

AI总结 CVP通过结合中央视觉和外围视觉的启发,提出了一种多模态模型,以提升复杂3D环境的空间推理能力。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06335 2025-12-10 cs.CV

Harnessing Object Grounding for Time-Sensitive Video Understanding

利用物体接地提升时间敏感视频理解

Tz-Ying Wu, Sharath Nittur Sridhar, Subarna Tripathi

机构 * Intel(英特尔公司)

AI总结 本文提出 GO-Tokenizer 以提升视频大型语言模型的时间敏感视频理解能力,通过实时编码紧凑的物体信息,提高模型性能并减少噪声影响。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12522 2025-12-10 cs.CV

MuSACo: Multimodal Subject-Specific Selection and Adaptation for Expression Recognition with Co-Training

MuSACo: 多模态主体特定选择与适应用于带有协同训练的表情识别

Muhammad Osama Zeeshan, Natacha Gillet, Alessandro Lameiras Koerich, Marco Pedersoli, Francois Bremond, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ÉTS Montreal(LIVIA,系统工程系,蒙特利尔ÉTS) École Polytechnique, Palaiseau(巴黎政治学院,Palaiseau) Centre INRIA d’Université Côte d’Azur, Sophia Antipolis(法国阿尔卑斯大学INRIA中心,Sophia Antipolis)

AI总结 MuSACo通过多模态协同训练方法提升主体特定表情识别的准确性和鲁棒性,适用于数字健康中的个性化评估。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07776 2025-12-09 cs.CV

GorillaWatch: An Automated System for In-the-Wild Gorilla Re-Identification and Population Monitoring

GorillaWatch: 一种用于野外大猩猩重识别与种群监测的自动化系统

Maximilian Schall, Felix Leonard Knöfel, Noah Elias König, Jan Jonas Kubeler, Maximilian von Klinski, Joan Wilhelm Linnemann, Xiaoshi Liu, Iven Jelle Schlegelmilch, Ole Woyciniuk, Alexandra Schild, Dante Wasmuht, Magdalena Bermejo Espinet, German Illera Basas, Gerard de Melo

机构 * Hasso Plattner Institute(哈索普拉特纳研究所) Conservation X Labs(保护X实验室) Sabine Plattner African Charities(萨宾·普拉特纳非洲慈善机构)

AI总结 GorillaWatch通过引入三个新数据集和端到端流程,实现了野外大猩猩的自动化重识别与种群监测,结合自监督预训练和可微分适应技术提升模型有效性。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07504 2025-12-09 cs.CV

ControlVP: Interactive Geometric Refinement of AI-Generated Images with Consistent Vanishing Points

ControlVP: 交互式几何校正AI生成图像以保持一致的消失点

Ryota Okumura, Kaede Shiohara, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

AI总结 ControlVP通过结合建筑轮廓的结构指导和几何约束,校正AI生成图像中的消失点不一致,提升空间结构真实性。

Comments Accepted to WACV 2026, 8 pages, supplementary included. Dataset and code: https://github.com/RyotaOkumura/ControlVP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07390 2025-12-09 cs.LG cs.CV

Towards Reliable Test-Time Adaptation: Style Invariance as a Correctness Likelihood

迈向可靠的测试时适应:风格不变性作为正确性的似然性

Gilhyun Nam, Taewon Kim, Joonhyun Jeong, Eunho Yang

AI总结 SICL通过利用风格不变性实现鲁棒的不确定性估计,有效降低校准误差,提升测试时适应的可靠性。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07383 2025-12-09 cs.CV

LogicCBMs: Logic-Enhanced Concept-Based Learning

逻辑增强的概念学习模型:LogicCBMs

Deepika SN Vemuri, Gautham Bellamkonda, Aditya Pola, Vineeth N Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度海得拉巴印度理工学院) Microsoft Research(微软研究院)

AI总结 LogicCBMs通过引入命题逻辑模块,增强概念学习模型的逻辑运算能力,提升模型的表达性和可解释性,实验证明其在准确性与可解释性上的优势。

Comments 18 pages, 19 figures, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07230 2025-12-09 cs.CV

STRinGS: Selective Text Refinement in Gaussian Splatting

STRinGS: 选择性文本细化在高斯点云中

Abhinav Raundhal, Gaurav Behera, P J Narayanan, Ravi Kiran Sarvadevabhatla, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(计算机视觉研究所,印度海得拉巴印度理工学院)

AI总结 STRinGS提出了一种文本感知的选性细化框架,通过分离文本和非文本区域并优化全场景,提升3DGS重建中文本的清晰度和可读性,同时引入OCR字符错误率评估和STRinGS-360数据集。

Comments Accepted to WACV 2026. Project Page, see https://STRinGS-official.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07034 2025-12-09 cs.CV cs.AI

Power of Boundary and Reflection: Semantic Transparent Object Segmentation using Pyramid Vision Transformer with Transparent Cues

边界与反射的力量:利用金字塔视觉Transformer与透明提示进行语义透明物体分割

Tuan-Anh Vu, Hai Nguyen-Truong, Ziqiang Zheng, Binh-Son Hua, Qing Guo, Ivor Tsang, Sai-Kit Yeung

AI总结 本文提出TransCues框架,通过结合边界和反射特征增强模块,提升透明物体分割性能,在多个基准数据集上取得显著提升。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05590 2025-12-09 eess.IV

General and Domain-Specific Zero-shot Detection of Generated Images via Conditional Likelihood

通过条件似然实现通用和领域特定的生成图像零样本检测

Roy Betser, Omer Hofman, Roman Vainshtein, Guy Gilboa

AI总结 CLIDE是一种基于条件似然的新型零样本图像检测方法,通过计算真实图像的似然实现对不同领域图像的适应,展现出在通用和领域特定任务中的优越性能。

Comments 8 pages, 6 figures, accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05113 2025-12-09 cs.CV

Splannequin: Freezing Monocular Mannequin-Challenge Footage with Dual-Detection Splatting

Splannequin: 通过双检测溅射实现单目人偶挑战视频的冻结3D场景

Hao-Jen Chien, Yi-Chuan Huang, Chung-Ho Wu, Wei-Lun Chao, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University The Ohio State University

AI总结 Splannequin通过双检测溅射技术,提升单目人偶挑战视频冻结3D场景的视觉质量,实现高保真用户可控的冻结时间渲染。

Comments WACV 2026. Project page: https://chien90190.github.io/splannequin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01302 2025-12-09 cs.CV

DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy

DCText: 通过分而治之策略实现视觉文本生成的调度注意力遮罩

Jaewoo Song, Jooyoung Choi, Kanghyun Baek, Sangyub Lee, Daemin Park, Sungroh Yoon

AI总结 DCText通过分而治之策略和注意力遮罩技术,实现高效视觉文本生成,提升长文本和多文本处理能力,同时保持图像质量和生成效率。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14997 2025-12-09 cs.CV cs.LG

Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression

基于图像回归的多模态大语言模型微调中的语言整合

Roy H. Jennings, Genady Paikin, Roy Shaul, Evgeny Soloveichik

机构 * Samsung Israel R&D Center(三星以色列研发中心)

AI总结 本文提出RvTC方法,通过灵活的区间法替代传统词汇受限分类,提升多模态大语言模型在图像回归任务中的性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18723 2025-12-09 eess.IV cs.CV cs.LG

MRI Reconstruction with Regularized 3D Diffusion Model (R3DM)

利用正则化的3D扩散模型(R3DM)进行MRI重建

Arya Bangun, Zhuo Cao, Alessio Quercia, Hanno Scharr, Elisabeth Pfaehler

机构 * IAS-8 INM-4 Forschungszentrum Jülich(INM-4 研究中心) RWTH Aachen University(亚琛工业大学)

AI总结 本文提出了一种基于正则化3D扩散模型的MRI重建方法,通过结合优化方法提升图像质量与保真度,实验表明其在欠采样数据下的重建性能优于现有方法。

Comments Accepted to WACV 2025,17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01254 2025-12-09 cs.CV

EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation

EmojiDiff: 高精度面部表情控制与高保真身份保持在肖像生成中

Liangwei Jiang, Ruida Li, Zhifeng Zhang, Shuo Fang, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

AI总结 EmojiDiff通过解耦训练和微调方法,实现了高精度面部表情控制与高保真身份保持的端到端肖像生成解决方案。

Comments accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14985 2025-12-09 cs.CV cs.AI

Image-Guided Semantic Pseudo-LiDAR Point Generation for 3D Object Detection

基于图像的语义伪LiDAR点生成用于3D目标检测

Minseung Lee, Seokha Moon, Seung Joon Lee, Reza Mahjourian, Jinkyu Kim

机构 * CSE, Korea University(韩国大学计算机科学与工程系) LG Innotek Waymo Research(Waymo研究院)

AI总结 ImagePG通过利用图像特征生成密集且语义丰富的3D点,提升自动驾驶中对小目标和远距离目标的检测性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01064 2025-12-09 cs.CV

Roadside Monocular 3D Detection Prompted by 2D Detection

道路旁单目3D检测受2D检测启发

Yechi Ma, Yanan Li, Wei Hua, Shu Kong

机构 * Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

AI总结 本文提出Pro3D,通过利用2D检测作为提示,提升道路旁单目3D检测的性能,实现更精确的3D定位。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06864 2025-12-09 cs.CV

Boosting Unsupervised Video Instance Segmentation with Automatic Quality-Guided Self-Training

通过自动质量引导的自训练提升无监督视频实例分割

Kaixuan Lu, Mehmet Onurcan Kaya, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 AutoQ-VIS通过质量引导的自训练方法,在无需人工标注的情况下实现了无监督视频实例分割的最新性能。

Comments Accepted to WACV 2026. arXiv admin note: substantial text overlap with arXiv:2508.19808

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06840 2025-12-09 cs.CV

CADE: Continual Weakly-supervised Video Anomaly Detection with Ensembles

CADE: 基于集成的持续弱监督视频异常检测

Satoshi Hashimoto, Tatsuya Konishi, Tomoya Kaichi, Kazunori Matsumoto, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究公司)

AI总结 CADE通过结合持续学习和弱监督方法,解决视频异常检测中的数据域变化和遗忘问题,提升检测性能。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06738 2025-12-09 cs.CV

FedSCAl: Leveraging Server and Client Alignment for Unsupervised Federated Source-Free Domain Adaptation

FedSCAl: 利用服务器与客户端对齐实现无监督联邦源域适应

M Yashwanth, Sampath Koti, Arunabh Singh, Shyam Marjit, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究院)

AI总结 FedSCAl通过引入服务器-客户端对齐机制,有效缓解联邦源域适应中的客户端漂移问题,提升伪标签准确性并优于现有方法。

Comments Accepted to Winter Conference on Applications of Computer Vision (WACV) 2026, Round 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06269 2025-12-09 cs.CV

TriaGS: Differentiable Triangulation-Guided Geometric Consistency for 3D Gaussian Splatting

TriaGS: 可微三角化引导的几何一致性用于3D高斯点扩散

Quan Tran, Tuan Dang

机构 * VinUniversity Ha Noi, Vietnam(越南河内Vin大学) University of Arkansas Fayetteville(阿肯色大学弗拉特维尔分校)

AI总结 TriaGS通过约束多视角三角化提升3D高斯点扩散的几何一致性,实现高保真表面重建。

Comments 10 pages

Journal ref WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01306 2025-12-09 cs.CV cs.GR

Gaussian Swaying: Surface-Based Framework for Aerodynamic Simulation with 3D Gaussians

高斯摆动:基于表面的使用3D高斯的气动模拟框架

Hongru Yan, Xiang Zhang, Zeyuan Chen, Fangyin Wei, Zhuowen Tu

机构 * UC San Diego(UC圣迭戈大学) Princeton University(普林斯顿大学)

AI总结 本文提出Gaussian Swaying框架,通过3D高斯连续建模表面,实现高效且细致的气动模拟,适用于视觉和图形中的真实感渲染。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22019 2025-12-09 cs.CV

Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language Models

类内概率嵌入用于视觉-语言模型中的不确定性估计

Zhenxiang Lin, Maryam Haghighat, Will Browne, Dimity Miller

机构 * Queensland University of Technology(昆士兰理工大学)

AI总结 本研究提出一种无需训练的后处理方法,通过类内概率嵌入提升视觉-语言模型的不确定性估计,有效检测错误预测。

Comments Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06791 2025-12-09 cs.CV cs.AI

Extreme Amodal Face Detection

极端不可见人脸检测

Changlin Song, Yunzhong Hou, Michael Randall Barnes, Rahul Shome, Dylan Campbell

AI总结 本文提出了一种基于热图的极端不可见人脸检测方法,通过上下文线索高效预测超出画面区域的人脸位置,优于生成方法。

Comments Accepted by WACV 2026, project page: https://charliesong1999.github.io/exaft_web/

详情

展开后加载摘要…

URL PDF HTML 收藏