arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 325
2510.00458 2026-07-07 cs.CV 版本更新

VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors

VLOD-TTA: 视觉语言目标检测器的测试时适应

Atif Belal, Heitor R. Medeiros, Marco Pedersoli, Eric Granger

机构 * International Laboratory on Learning Systems (ILLS)(国际学习系统实验室(ILLS))

AI总结 本文提出VLOD-TTA,通过密集提案重叠和图像条件提示实现低开销的视觉语言目标检测器测试时适应,优于现有方法。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06576 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新

BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations

BEVLM:将语言模型中的语义知识提炼到鸟瞰视图表示中

Thomas Monninger, Shaoyuan Xie, Qi Alfred Chen, Sihao Ding

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰研发北美研究所) University of California, Irvine(加州大学伊尔弗分校)

AI总结 研究将大语言模型集成到自动驾驶,针对现有方法冗余计算、空间一致性受限等问题,提出BEVLM框架,连接鸟瞰视图表示与大语言模型,能有效提升跨视图驾驶场景推理准确性及端到端驾驶性能。

Comments Accepted to the 2026 European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10099 2026-07-07 cs.LG cs.CV 版本更新

Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders

流形上的学习:通过表示编码器解锁标准扩散变压器

Amandeep Kumar, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究利用表示编码器进行生成建模时标准扩散变压器收敛失败的问题,指出根本原因是几何干扰,提出黎曼流匹配与雅可比正则化方法,使标准扩散变压器无需宽度缩放就能收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14788 2026-07-07 cs.CV 版本更新

Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation

用于文本到运动生成的重建锚定扩散模型

Yifei Liu, Changxing Ding, Ling Guo, Huaiguang Jiang, Qiong Cao

机构 * South China University of Technology(华南理工大学) Joy Future Academy(京东探索研究院)

AI总结 针对文本驱动人体运动生成中预训练文本编码器存在表征差距及迭代去噪过程中误差传播问题,提出重建锚定扩散模型,利用运动潜在空间监督,采用自正则化等目标函数训练,还提出重建误差引导机制,实验表明性能显著提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03024 2026-07-07 cs.CV 版本更新

SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection

SA-ResGS:用于下一个最佳视图选择的自增强残差3D高斯点云绘制

Kim Jun-Seong, Tae-Hyun Oh, Eduardo Pérez-Pellitero, Youngkyoon Jang

机构 * POSTECH(POSTECH大学) KAIST(韩国科学技术院) Huawei Noah’s Ark Lab(华为诺亚实验室) Rivian

AI总结 提出SA-ResGS框架,通过生成自增强点云稳定不确定性量化,增强不确定性感知监督。采用残差学习策略应对高斯分布监督不足问题,贡献包括物理视图选择策略、不确定性感知残差监督方案等,实验表明其性能优于基线。

Comments Accepted at ECCV 2026. Project page: https://saresgs.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13660 2026-07-07 cs.RO cs.CV 版本更新

Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

面向机器人视觉-语言模型的具有推理能力的空间轨迹

Enshen Zhou, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。

Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02211 2026-07-07 cs.CV 版本更新

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

TexTailor:用于多模态扩散变压器的推理时文本引导剪裁

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

AI总结 研究基于变压器的扩散模型中不同模块与文本条件的交互。通过系统管道分析各模块功能,提出推理时逐块文本引导剪裁方法,提升文本图像对齐,有多种下游应用,实验表明优于基线。

Comments To appear in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18176 2026-07-07 cs.CV 版本更新

Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation

图谱是理想上下文:用于可泛化基础医学图像分割的一次性定制

Ziyu Zhang, Yi Yu, Simeng Zhu, Ahmed Aly, Yunhe Gao, Ning Gu, Yuan Xue

机构 * Nanjing University(南京大学) The Ohio State University(俄亥俄州立大学) Stanford University(斯坦福大学)

AI总结 研究医学图像中解剖结构分割问题,提出图谱引导框架AtlasSegFM,通过图谱查询配准生成提示,用冻结基础模型细化分割,经自适应融合模块结合图谱先验与模型输入及预测,实现一次性定制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10730 2026-07-07 cs.CV 版本更新

IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation

IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化

Yuan-Ming Li, Qize Yang, Nan Lei, Shenghao Fu, Ling-An Zeng, Jian-Fang Hu, Xihan Wei, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)

AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05672 2026-07-07 cs.CV cs.AI cs.LG 版本更新

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter:作为潜在域逆问题的高效视频重新捕捉

Yeobin Hong, Suhyeon Lee, Hyungjin Chung, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) EverEx, South Korea(韩国EverEx公司) Korea University, South Korea(韩国国立庆熙大学)

AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20272 2026-07-07 cs.CV 版本更新

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

VKnowU:评估多模态语言模型中的视觉知识理解

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。

Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17918 2026-07-07 cs.CV 版本更新

Do Flat Minima Improve Sparse Novel View Synthesis?

平坦最小值能改善稀疏新视图合成吗?

Youngsik Yun, Dongjun Gu, Youngjung Uh

机构 * Yonsei University(延世大学)

AI总结 研究新视图合成中损失锐度与泛化的关系,提出结构感知锐度并根据局部图像结构自适应调整锐度正则化权重,可在保持细节重建所需锐度的同时促进泛化,提升多种基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15706 2026-07-07 cs.CV 版本更新

RoMa v2: Harder Better Faster Denser Feature Matching

RoMa v2:更优更快更密集的特征匹配

Johan Edstedt, David Nordström, Yushan Zhang, Georg Bökman, Jonathan Astermark, Viktor Larsson, Anders Heyden, Fredrik Kahl, Mårten Wadenbäck, Michael Felsberg

机构 * Linköping University(_linköping大学) Chalmers University of Technology(_chalmers技术大学) University of Amsterdam(_阿姆斯特丹大学) Centre for Mathematical Sciences, Lund University(_数学科学中心,吕勒奥大学)

AI总结 研究针对现有密集匹配器在复杂场景中表现不佳及高精度模型慢等弱点,通过系列改进构建新架构与损失函数,采用解耦管道加速训练、减少内存使用,利用基础模型提升鲁棒性,新匹配器达新的技术水平。

Comments ECCV 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17801 2026-07-07 cs.RO cs.CV 版本更新

Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

Robobench:作为具身大脑的多模态大语言模型的综合评估基准

Yulin Luo, Chun-Kai Fan, Menghang Dong, Jiayu Shi, Xiangju Mi, Mengdi Zhao, Bo-Wen Zhang, Cheng Chi, Jiaming Liu, Gaole Dai, Rongyu Zhang, Ruichuan An, Kun Wu, Zhengping Che, Shaoxuan Xie, Guocai Yao, Zhongxia Zhao, Pengwei Wang, Guang Liu, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学) University of Science and Technology Beijing(北京科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 研究针对在动态非结构化环境中构建能感知、推理和行动的机器人的挑战,介绍RoboBench基准,涵盖多维度、多任务等,能评估多模态大语言模型,揭示其局限性并分析与下游控制关系,为量化高级认知提供支架。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24181 2026-07-07 cs.CV 版本更新

Combining Discrepancy-Confusion Uncertainty and Calibration Diversity for Active Fine-Grained Image Classification

结合差异-混淆不确定性和校准多样性用于主动细粒度图像分类

Yinghao Jin, Xi Yang

机构 * Jilin University(吉林大学)

AI总结 研究针对细粒度图像分类中可靠评估样本信息难的问题,提出DECERN方法,结合差异-混淆不确定性和校准多样性来衡量样本信息,经加权聚类和校准多样性,提升主动学习性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12046 2026-07-07 cs.CV cs.AI 版本更新

Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking

通过结构化掩码的布局条件自回归文本到图像生成

Zirui Zheng, Takashi Isobe, Tong Shen, Xu Jia, Jianbin Zhao, Xiaomin Li, Mengmeng Ge, Baolu Li, Qinghe Wang, Haiwen Diao, Dong Li, Dong Zhou, Yunzhi Zhuge, Huchuan Lu, Emad Barsoum

机构 * Advanced Micro Devices Inc.(超威半导体公司) Dalian University of Technology(大连理工大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

AI总结 提出SMARLI框架,通过结构化掩码策略将布局约束注入自回归生成过程,并采用GRPO后训练缓解曝光偏差,实现高质量布局控制图像生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23102 2026-07-07 eess.IV cs.CV 版本更新

Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation

区域感知多模态大语言模型:基于慢快标记化与伪掩码引导的3D CT报告生成

Sunggu Kyung, Jinyoung Seo, Hyunseok Lim, Dongyeong Kim, Hyungbin Park, Jimin Sung, Jihyun Kim, Wooyoung Jo, Yoojin Nam, Namkug Kim

机构 * Department of Convergence Medicine, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院融合医学系) University of Ulsan College of Medicine, Seoul, Republic of Korea(韩国首尔蔚山大学医学院) Department of Radiology and Research Institute of Radiology, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院放射科与放射学研究所)

AI总结 提出MedRegion-CT框架,通过区域慢快标记器联合建模全局与细粒度信息、伪掩码引导关注诊断关键区域、结构化病变信息提示,实现高质量CT报告生成,在多项指标上达到最优。

Comments Accepted to ECCV 2026. 15 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09484 2026-07-07 cs.CV 版本更新

Purify then Guide: Rethinking Domain Generalization for Multimodal Face Anti-Spoofing

净化然后引导:重新思考多模态人脸反欺骗的领域泛化

Yingjie Ma, Xun Lin, Zitong Yu, Haonan Wang, Ruixin Zhang, Shouhong Ding, Xin Liu, Xiaochen Yuan, Weicheng Xie, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computing and Information Technology, Great Bay University(大湾区大学计算与信息科技学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息处理重点实验室) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室) Tencent Youtu Lab(腾讯优图实验室) School of Psychology, Shanghai Jiao Tong University(上海交通大学心理学院) Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究多模态人脸反欺骗中领域泛化问题,提出MMDA框架,利用CLIP零样本泛化能力,通过去噪和对齐机制提升跨模态对齐泛化性能,含多个模块及策略,实验表明优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.14019 2026-07-07 cs.CV cs.AI cs.HC cs.LG 版本更新

Domain Knowledge-Informed Self-Supervised Representations for Workout Form Assessment

用于健身动作形式评估的领域知识驱动自监督表示

Paritosh Parmar, Amol Gharat, Helge Rhodin

机构 * University of British Columbia(不列颠哥伦比亚大学) FlexAI Inc.(FlexAI公司)

AI总结 研究健身动作形式评估问题,提出基于领域知识的自监督方法,利用动作谐波运动及多因素差异学习强大表示,创建新数据集,实验表明自监督表示优于现有方法且可用于其他领域。

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28864 2026-07-03 cs.CV 版本更新

On Test-Time Scaling for Vision-Language Models

关于视觉-语言模型的测试时扩展

Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis

机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO部门) imec

AI总结 本文系统研究了视觉-语言模型(LVLM)的测试时扩展方法,发现小型高性能模型受益最大,性能提升可达30%,并揭示了视觉信息在推理链早期编码后图像令牌贡献显著下降。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29691 2026-07-03 cs.CV 版本更新

Unsupervised Semantic Segmentation Facilitates Model Understanding

无监督语义分割促进模型理解

Xiaoyan Yu, Lisa Mais, Jannik Franzen, Peter Hirsch, Nick Lechtenbörger, Andreas Mardt, Dagmar Kainmüller

机构 * Max-Delbruck-Center(马克斯·德尔布鲁克中心) Helmholtz Imaging(海德堡成像) Humboldt-Universität zu Berlin(柏林洪堡大学) Charité Universitätsmedizin(夏里特大学医学院) University of Potsdam(波茨坦大学)

AI总结 提出基于无监督语义分割的可视化协议,直观揭示不同自监督视觉Transformer的注意力机制、位置偏差和缩放行为等模型特性。

Comments Camera-ready version of paper accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26283 2026-07-03 cs.CV cs.AI 版本更新

MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution

MedSynapse-V:通过潜在记忆演化桥接视觉感知与临床直觉

Chunzheng Zhu, Jiaqi Zeng, Junyu Jiang, Jianxin Lin, Yijun Wang

机构 * Hunan University(湖南大学)

AI总结 提出MedSynapse-V框架,通过潜在诊断记忆演化模拟临床专家经验调用,解决医学视觉语言模型因离散分词导致的量化损失、长程信息消散和案例适应性问题,在诊断准确性上显著超越现有方法。

Comments ECCV 2026; Medical latent reasoning; Memory evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02546 2026-07-03 cs.CV cs.LG 版本更新

RGB-Pointmap Pretraining for Unified 3D Scene Understanding

对比语言-彩色点图预训练用于统一3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(帝国理工学院伦敦分校)

AI总结 提出UniScene3D,一种基于Transformer的编码器,通过多视图彩色点图联合建模外观和几何,并引入跨视图几何对齐和接地视图对齐,在少样本和任务特定微调中达到SOTA。

Comments 19 Pages, ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01761 2026-07-03 cs.CV 版本更新

Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion

Control-DINO:用于可控图像到视频扩散的特征空间条件

Edoardo A. Dominici, Thomas Deixelberger, Konstantinos Vardis, Markus Steinberger

机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) Huawei Technologies, Austria(华为技术(奥地利)) Graz University of Technology, Austria(格拉茨技术大学)

AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。

Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27999 2026-07-03 cs.CV 版本更新

CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition

CLIP-AUTT: 基于动作单元提示的测试时个性化方法用于细粒度视频情绪识别

Muhammad Osama Zeeshan, Masoumeh Sharafi, Benoit Savary, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal(LIVIA, ILLS, 系统工程学院, 蒙特利尔高等技术学院) LIVIA, Dept. of Software and IT Engineering, ETS Montreal(LIVIA, 软件与IT工程学院, 蒙特利尔高等技术学院) Dept. of Computer Science, École Polytechnique(计算机科学系, 巴黎综合理工学院)

AI总结 本文提出CLIP-AUTT,通过动作单元提示实现测试时个性化,提升细粒度视频情绪识别的鲁棒性和个性化能力。

Comments ECCV, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28896 2026-07-03 cs.CV 版本更新

Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses

Fisheye3R:将统一的3D前馈基础模型适应于鱼眼镜头

Ruxiao Duan, Erin Hong, Dongxu Zhao, Eric Turner, Alex Wong, Yunwen Zhou

机构 * Yale University(耶鲁大学) Google XR(谷歌XR)

AI总结 本文提出Fisheye3R框架,通过灵活学习方案在不退化性能的前提下,使多视角3D重建模型适应高径向畸变的鱼眼图像。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19013 2026-07-03 cs.CV 版本更新

GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness

GenHOI:具有遮挡意识的通用手-物体姿态估计

Hui Yang, Wei Sun, Jian Liu, Jian Xiao, Tao Xie, Hossein Rahmani, Ajmal Saeed Mian, Nicu Sebe, Gim Hee Lee

机构 * Hunan University(湖南大学) Lancaster University(兰卡斯特大学) University of Western Australia(西澳大学) University of Trento(特伦托大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出GenHOI框架,通过整合层次语义知识与手部先验,提升在遮挡条件下手-物体姿态估计的泛化能力,实验表明在DexYCB和HO3Dv2基准上达到SOTA性能。

Comments European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24969 2026-07-03 cs.CV 版本更新

PASDiff: Physics-Aware Semantic Guidance for Joint Real-World Low-Light Face Enhancement and Restoration

PASDiff: 面向真实世界低光人脸增强与恢复的物理感知语义引导

Yilin Ni, Wenjie Li, Zhengxue Wang, Juncheng Li, Guangwei Gao, Jian Yang

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Beijing University of Posts and Telecommunications(北京邮电大学) PCA Lab, Nanjing University of Science and Technology(南京理工大学PCA实验室) East China Normal University(华东师范大学)

AI总结 提出PASDiff,一种无需训练的物理感知语义扩散模型,通过逆强度加权和Retinex理论引入光度约束,并利用风格无关结构注入从现成人脸先验中提取结构,在真实低光人脸增强上实现自然光照、色彩恢复和身份一致性的优越平衡。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09446 2026-07-03 cs.CV 版本更新

Defect-aware Hybrid Prompt Optimization via Progressive Tuning for Zero-Shot Multi-type Anomaly Detection and Segmentation

基于渐进调优的缺陷感知混合提示优化用于零样本多类型异常检测与分割

Nadeem Nazer, Hongkuan Zhou, Lavdim Halilaj, Ylli Sadikaj, Steffen Staab

机构 * Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) Otto-von-Guericke-University(奥托·冯·格里克大学) Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) Faculty of Computer Science, UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学系) University of Southampton(南安普顿大学)

AI总结 提出DAPO框架,通过混合提示机制结合可读缺陷描述与可学习嵌入,对齐异常视觉特征与文本语义,在零样本多类型异常检测与分割任务中平均提升AUROC 3.6%和5.2%。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏