arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Winter Conference on Applications of Computer Vision · 会议 · Computer Vision

2025-12-09 至 2025-12-09 共收录 23
2512.07776 2025-12-09 cs.CV

GorillaWatch: An Automated System for In-the-Wild Gorilla Re-Identification and Population Monitoring

GorillaWatch: 一种用于野外大猩猩重识别与种群监测的自动化系统

Maximilian Schall, Felix Leonard Knöfel, Noah Elias König, Jan Jonas Kubeler, Maximilian von Klinski, Joan Wilhelm Linnemann, Xiaoshi Liu, Iven Jelle Schlegelmilch, Ole Woyciniuk, Alexandra Schild, Dante Wasmuht, Magdalena Bermejo Espinet, German Illera Basas, Gerard de Melo

机构 * Hasso Plattner Institute(哈索普拉特纳研究所) Conservation X Labs(保护X实验室) Sabine Plattner African Charities(萨宾·普拉特纳非洲慈善机构)

AI总结 GorillaWatch通过引入三个新数据集和端到端流程,实现了野外大猩猩的自动化重识别与种群监测,结合自监督预训练和可微分适应技术提升模型有效性。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07504 2025-12-09 cs.CV

ControlVP: Interactive Geometric Refinement of AI-Generated Images with Consistent Vanishing Points

ControlVP: 交互式几何校正AI生成图像以保持一致的消失点

Ryota Okumura, Kaede Shiohara, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

AI总结 ControlVP通过结合建筑轮廓的结构指导和几何约束,校正AI生成图像中的消失点不一致,提升空间结构真实性。

Comments Accepted to WACV 2026, 8 pages, supplementary included. Dataset and code: https://github.com/RyotaOkumura/ControlVP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07390 2025-12-09 cs.LG cs.CV

Towards Reliable Test-Time Adaptation: Style Invariance as a Correctness Likelihood

迈向可靠的测试时适应:风格不变性作为正确性的似然性

Gilhyun Nam, Taewon Kim, Joonhyun Jeong, Eunho Yang

AI总结 SICL通过利用风格不变性实现鲁棒的不确定性估计,有效降低校准误差,提升测试时适应的可靠性。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07383 2025-12-09 cs.CV

LogicCBMs: Logic-Enhanced Concept-Based Learning

逻辑增强的概念学习模型:LogicCBMs

Deepika SN Vemuri, Gautham Bellamkonda, Aditya Pola, Vineeth N Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度海得拉巴印度理工学院) Microsoft Research(微软研究院)

AI总结 LogicCBMs通过引入命题逻辑模块,增强概念学习模型的逻辑运算能力,提升模型的表达性和可解释性,实验证明其在准确性与可解释性上的优势。

Comments 18 pages, 19 figures, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07230 2025-12-09 cs.CV

STRinGS: Selective Text Refinement in Gaussian Splatting

STRinGS: 选择性文本细化在高斯点云中

Abhinav Raundhal, Gaurav Behera, P J Narayanan, Ravi Kiran Sarvadevabhatla, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(计算机视觉研究所,印度海得拉巴印度理工学院)

AI总结 STRinGS提出了一种文本感知的选性细化框架,通过分离文本和非文本区域并优化全场景,提升3DGS重建中文本的清晰度和可读性,同时引入OCR字符错误率评估和STRinGS-360数据集。

Comments Accepted to WACV 2026. Project Page, see https://STRinGS-official.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07034 2025-12-09 cs.CV cs.AI

Power of Boundary and Reflection: Semantic Transparent Object Segmentation using Pyramid Vision Transformer with Transparent Cues

边界与反射的力量:利用金字塔视觉Transformer与透明提示进行语义透明物体分割

Tuan-Anh Vu, Hai Nguyen-Truong, Ziqiang Zheng, Binh-Son Hua, Qing Guo, Ivor Tsang, Sai-Kit Yeung

AI总结 本文提出TransCues框架,通过结合边界和反射特征增强模块,提升透明物体分割性能,在多个基准数据集上取得显著提升。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05590 2025-12-09 eess.IV

General and Domain-Specific Zero-shot Detection of Generated Images via Conditional Likelihood

通过条件似然实现通用和领域特定的生成图像零样本检测

Roy Betser, Omer Hofman, Roman Vainshtein, Guy Gilboa

AI总结 CLIDE是一种基于条件似然的新型零样本图像检测方法,通过计算真实图像的似然实现对不同领域图像的适应,展现出在通用和领域特定任务中的优越性能。

Comments 8 pages, 6 figures, accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05113 2025-12-09 cs.CV

Splannequin: Freezing Monocular Mannequin-Challenge Footage with Dual-Detection Splatting

Splannequin: 通过双检测溅射实现单目人偶挑战视频的冻结3D场景

Hao-Jen Chien, Yi-Chuan Huang, Chung-Ho Wu, Wei-Lun Chao, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University The Ohio State University

AI总结 Splannequin通过双检测溅射技术,提升单目人偶挑战视频冻结3D场景的视觉质量,实现高保真用户可控的冻结时间渲染。

Comments WACV 2026. Project page: https://chien90190.github.io/splannequin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01302 2025-12-09 cs.CV

DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy

DCText: 通过分而治之策略实现视觉文本生成的调度注意力遮罩

Jaewoo Song, Jooyoung Choi, Kanghyun Baek, Sangyub Lee, Daemin Park, Sungroh Yoon

AI总结 DCText通过分而治之策略和注意力遮罩技术,实现高效视觉文本生成,提升长文本和多文本处理能力,同时保持图像质量和生成效率。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14997 2025-12-09 cs.CV cs.LG

Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression

基于图像回归的多模态大语言模型微调中的语言整合

Roy H. Jennings, Genady Paikin, Roy Shaul, Evgeny Soloveichik

机构 * Samsung Israel R&D Center(三星以色列研发中心)

AI总结 本文提出RvTC方法,通过灵活的区间法替代传统词汇受限分类,提升多模态大语言模型在图像回归任务中的性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18723 2025-12-09 eess.IV cs.CV cs.LG

MRI Reconstruction with Regularized 3D Diffusion Model (R3DM)

利用正则化的3D扩散模型(R3DM)进行MRI重建

Arya Bangun, Zhuo Cao, Alessio Quercia, Hanno Scharr, Elisabeth Pfaehler

机构 * IAS-8 INM-4 Forschungszentrum Jülich(INM-4 研究中心) RWTH Aachen University(亚琛工业大学)

AI总结 本文提出了一种基于正则化3D扩散模型的MRI重建方法,通过结合优化方法提升图像质量与保真度,实验表明其在欠采样数据下的重建性能优于现有方法。

Comments Accepted to WACV 2025,17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01254 2025-12-09 cs.CV

EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation

EmojiDiff: 高精度面部表情控制与高保真身份保持在肖像生成中

Liangwei Jiang, Ruida Li, Zhifeng Zhang, Shuo Fang, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

AI总结 EmojiDiff通过解耦训练和微调方法,实现了高精度面部表情控制与高保真身份保持的端到端肖像生成解决方案。

Comments accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14985 2025-12-09 cs.CV cs.AI

Image-Guided Semantic Pseudo-LiDAR Point Generation for 3D Object Detection

基于图像的语义伪LiDAR点生成用于3D目标检测

Minseung Lee, Seokha Moon, Seung Joon Lee, Reza Mahjourian, Jinkyu Kim

机构 * CSE, Korea University(韩国大学计算机科学与工程系) LG Innotek Waymo Research(Waymo研究院)

AI总结 ImagePG通过利用图像特征生成密集且语义丰富的3D点,提升自动驾驶中对小目标和远距离目标的检测性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01064 2025-12-09 cs.CV

Roadside Monocular 3D Detection Prompted by 2D Detection

道路旁单目3D检测受2D检测启发

Yechi Ma, Yanan Li, Wei Hua, Shu Kong

机构 * Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

AI总结 本文提出Pro3D,通过利用2D检测作为提示,提升道路旁单目3D检测的性能,实现更精确的3D定位。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06864 2025-12-09 cs.CV

Boosting Unsupervised Video Instance Segmentation with Automatic Quality-Guided Self-Training

通过自动质量引导的自训练提升无监督视频实例分割

Kaixuan Lu, Mehmet Onurcan Kaya, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 AutoQ-VIS通过质量引导的自训练方法,在无需人工标注的情况下实现了无监督视频实例分割的最新性能。

Comments Accepted to WACV 2026. arXiv admin note: substantial text overlap with arXiv:2508.19808

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06840 2025-12-09 cs.CV

CADE: Continual Weakly-supervised Video Anomaly Detection with Ensembles

CADE: 基于集成的持续弱监督视频异常检测

Satoshi Hashimoto, Tatsuya Konishi, Tomoya Kaichi, Kazunori Matsumoto, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究公司)

AI总结 CADE通过结合持续学习和弱监督方法,解决视频异常检测中的数据域变化和遗忘问题,提升检测性能。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06738 2025-12-09 cs.CV

FedSCAl: Leveraging Server and Client Alignment for Unsupervised Federated Source-Free Domain Adaptation

FedSCAl: 利用服务器与客户端对齐实现无监督联邦源域适应

M Yashwanth, Sampath Koti, Arunabh Singh, Shyam Marjit, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究院)

AI总结 FedSCAl通过引入服务器-客户端对齐机制,有效缓解联邦源域适应中的客户端漂移问题,提升伪标签准确性并优于现有方法。

Comments Accepted to Winter Conference on Applications of Computer Vision (WACV) 2026, Round 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06269 2025-12-09 cs.CV

TriaGS: Differentiable Triangulation-Guided Geometric Consistency for 3D Gaussian Splatting

TriaGS: 可微三角化引导的几何一致性用于3D高斯点扩散

Quan Tran, Tuan Dang

机构 * VinUniversity Ha Noi, Vietnam(越南河内Vin大学) University of Arkansas Fayetteville(阿肯色大学弗拉特维尔分校)

AI总结 TriaGS通过约束多视角三角化提升3D高斯点扩散的几何一致性,实现高保真表面重建。

Comments 10 pages

Journal ref WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01306 2025-12-09 cs.CV cs.GR

Gaussian Swaying: Surface-Based Framework for Aerodynamic Simulation with 3D Gaussians

高斯摆动:基于表面的使用3D高斯的气动模拟框架

Hongru Yan, Xiang Zhang, Zeyuan Chen, Fangyin Wei, Zhuowen Tu

机构 * UC San Diego(UC圣迭戈大学) Princeton University(普林斯顿大学)

AI总结 本文提出Gaussian Swaying框架,通过3D高斯连续建模表面,实现高效且细致的气动模拟,适用于视觉和图形中的真实感渲染。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22019 2025-12-09 cs.CV

Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language Models

类内概率嵌入用于视觉-语言模型中的不确定性估计

Zhenxiang Lin, Maryam Haghighat, Will Browne, Dimity Miller

机构 * Queensland University of Technology(昆士兰理工大学)

AI总结 本研究提出一种无需训练的后处理方法,通过类内概率嵌入提升视觉-语言模型的不确定性估计,有效检测错误预测。

Comments Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06791 2025-12-09 cs.CV cs.AI

Extreme Amodal Face Detection

极端不可见人脸检测

Changlin Song, Yunzhong Hou, Michael Randall Barnes, Rahul Shome, Dylan Campbell

AI总结 本文提出了一种基于热图的极端不可见人脸检测方法,通过上下文线索高效预测超出画面区域的人脸位置,优于生成方法。

Comments Accepted by WACV 2026, project page: https://charliesong1999.github.io/exaft_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18594 2025-12-09 cs.CV cs.AI cs.LG

DRWKV: Focusing on Object Edges for Low-Light Image Enhancement

DRWKV:聚焦于物体边缘的低光照图像增强

Xuecheng Bai, Yuxiang Wang, Boyu Hu, Qinyuan Jie, Chuanzhi Xu, Kechen Li, Hongru Xiao, Vera Chung

机构 * Shenyang Ligong University(沈阳理工大学) The University of Sydney(悉尼大学) University of International Business and Economics(国际商务经济大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Tongji University(同济大学)

AI总结 DRWKV通过整合全局边缘视网膜理论和进化WKV注意力机制,有效提升低光照图像增强的边缘保真度和视觉自然度,实现高PSNR、SSIM和NIQE性能,并在多目标跟踪任务中展现良好的泛化能力。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14670 2025-12-09 cs.CV

Gene-DML: Dual-Pathway Multi-Level Discrimination for Gene Expression Prediction from Histopathology Images

Gene-DML:双路径多级判别用于从组织病理图像预测基因表达

Yaxuan Song, Jianan Fan, Hang Chang, Weidong Cai

机构 * The University of Sydney, Australia(悉尼大学) Lawrence Berkeley National Laboratory, USA(伯克利国家实验室)

AI总结 Gene-DML通过双路径多级判别方法,提升组织病理图像与基因表达谱的跨模态对齐,实现高精度的基因表达预测。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision 2026 (WACV2026). Code and data available at https://github.com/YXSong000/Gene-DML

详情

展开后加载摘要…

URL PDF HTML 收藏