arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.26597 2026-03-30 cs.CV

From Static to Dynamic: Exploring Self-supervised Image-to-Video Representation Transfer Learning

从静态到动态:探索自监督图像到视频表示迁移学习

Yang Liu, Qianqian Xu, Peisong Wen, Siran Dai, Xilin Zhao, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

AI总结 本文提出Co-Settle框架,通过轻量投影层调整表示空间,平衡视频内时间一致性和跨视频语义分离性,实验显示在多个视频任务上提升效果。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26586 2026-03-30 cs.CV

MA-Bench: Towards Fine-grained Micro-Action Understanding

MA-Bench:迈向细粒度微动作理解

Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo

机构 * CVLab, College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院CVLab) University College London(伦敦大学学院) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出MA-Bench基准,包含1000个视频和三级评估架构,系统评估微动作识别与解释,通过23个MLLM的实验发现微动作细粒度理解存在挑战,并构建MA-Bench-Train训练集提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26362 2026-03-30 cs.CV

HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models

HandVQA: 评估视觉-语言模型中手部精细空间推理的诊断与改进

MD Khalequzzaman Chowdhury Sayem, Mubarrat Tajoar Chowdhury, Yihalem Yimolal Tiruneh, Muneeb A. Khan, Muhammad Salman Ali, Binod Bhattarai, Seungryul Baek

机构 * UNIST(蔚山科学技术院) University of Aberdeen(阿伯丁大学) University College London(伦敦大学学院) Fogsphere (Redev.AI Ltd), UK(Fogsphere (Redev.AI Ltd),英国)

AI总结 HandVQA通过视觉问答评估VLM对手部解剖的精细空间理解,发现现有模型在手部关节空间关系推理上的系统性缺陷,并通过3D数据训练提升模型在手部姿态识别和手-物交互任务中的性能。

Comments Accepted in CVPR 2026; Project page, code, and dataset: https://kcsayem.github.io/handvqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26354 2026-03-30 cs.CV

Only Whats Necessary: Pareto Optimal Data Minimization for Privacy Preserving Video Anomaly Detection

只保留必要内容:面向隐私保护视频异常检测的帕累托最优数据最小化

Nazia Aslam, Abhisek Ray, Thomas B. Moeslund, Kamal Nasrollahi

机构 * Aalborg University(奥尔堡大学) Aarhus University(奥胡斯大学) Milestone System

AI总结 本文提出Only What's Necessary框架,通过结合广度和深度的数据最小化机制,在保护隐私的同时保持异常检测相关线索,通过实验验证其在隐私与效用间的平衡效果。

Comments 10 pages, CVPR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26336 2026-03-30 cs.CV

From Pixels to Privacy: Temporally Consistent Video Anonymization via Token Pruning for Privacy Preserving Action Recognition

从像素到隐私:通过令牌修剪实现时间一致的视频匿名化以保护隐私的行动识别

Nazia Aslam, Abhisek Ray, Joakim Bruslund Haurum, Lukas Esterle, Kamal Nasrollahi

机构 * Aalborg University(奥尔堡大学) Aarhus University(奥胡斯大学) Poineer Centre for AI(先锋人工智能中心) University of Southern Denmark(南丹麦大学) Milestone System(Milestone系统公司)

AI总结 本文提出一种基于注意力机制的时空视频匿名化框架,通过分离效用和隐私特征,实现对隐私保护的行动识别。

Comments 10 pages, CVPR paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26328 2026-03-30 cs.CV

Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization

通过边界感知提示优化验证声称的文本到图像模型

Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Nankai University(南开大学) Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出边界感知提示优化方法,通过识别模型特定的边界相邻提示来验证文本到图像模型的真实性,实验显示其验证准确率优越。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26317 2026-03-30 cs.CV cs.AI cs.LG

Label-Free Cross-Task LoRA Merging with Null-Space Compression

无标签跨任务LoRA融合与空域压缩

Wonyoung Lee, Wooseong Jeong, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 本文提出无标签的NSC融合方法,通过适配器几何设置合并权重,实现跨分类、回归和序列生成任务的高效融合,优于现有方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26316 2026-03-30 cs.CV cs.LG

SALMUBench: A Benchmark for Sensitive Association-Level Multimodal Unlearning

SALMUBench:一种用于敏感关联级多模态反训练的基准

Cai Selvas-Sala, Lei Kang, Lluis Gomez

机构 * Computer Vision Center(计算机视觉中心) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

AI总结 本文提出SALMUBench基准,用于评估多模态反训练中敏感信息删除的效果,通过合成数据和基础模型测试发现现有方法存在遗忘不足或过度泛化问题。

Comments Accepted to CVPR 2026. Project page: http://cvc-mmu.github.io/salmubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26299 2026-03-30 cs.CV cs.AI cs.LG

Preference-Aligned LoRA Merging: Preserving Subspace Coverage and Addressing Directional Anisotropy

偏好对齐的LoRA融合:保持子空间覆盖与解决方向各向异性

Wooseong Jeong, Wonyoung Lee, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 本文提出TARA-Merging方法,通过偏好加权交叉熵伪损失对齐融合权重,保持任务相关LoRA子空间,提升子空间覆盖和缓解各向异性,实验显示优于基线方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26260 2026-03-30 cs.CV cs.AI

GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentation

GeoGuide:基于层次几何引导的开放词汇3D语义分割

Xujing Tao, Chuxin Wang, Yubo Ai, Zhixin Cheng, Zhuoyuan Li, Liangsheng Liu, Yujia Chen, Xinjun Li, Qiao Li, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(深空探测全国重点实验室,深空探测实验室)

AI总结 GeoGuide提出了一种新的框架,通过预训练3D模型整合层次几何-语义一致性,以提升开放词汇3D分割的性能,通过不确定性基于的超点蒸馏模块和实例级掩码重建模块等方法增强局部语义一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26181 2026-03-30 cs.CV

GLINT: Modeling Scene-Scale Transparency via Gaussian Radiance Transport

GLINT:通过高斯辐射传输建模场景级透明度

Youngju Na, Jaeseong Yun, Soohyun Ryu, Hyunsu Kim, Sung-Eui Yoon, Suyong Yeon

机构 * KAIST(韩国科学技术院) NAVER LABS

AI总结 GLINT通过显式分解的高斯表示建模场景级透明度,分离反射和透射辐射,利用几何分离线索和预训练视频照明模型提升透明场景重建性能。

Comments CVPR 2026, Project page: https://youngju-na.github.io/GLINT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26127 2026-03-30 cs.CV cs.AI cs.CL cs.LG cs.MM

Finding Distributed Object-Centric Properties in Self-Supervised Transformers

在自监督变压器中发现分布式以对象为中心的属性

Samyak Rawlekar, Amitabh Swain, Yujun Cai, Yiwei Wang, Ming-Hsuan Yang, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Queensland(昆士兰大学) UC Merced(加州大学默塞德分校)

AI总结 本文分析了自监督视觉变压器中对象中心属性的分布式编码机制,提出Object-DINO方法通过聚类注意力头提升无监督对象发现和多模态大语言模型的视觉 grounding。

Comments Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26113 2026-03-30 cs.MM cs.SD eess.AS

Cinematic Audio Source Separation Using Visual Cues

电影音频源分离使用视觉线索

Kang Zhang, Suyeon Lee, Arda Senocak, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) Graduate School of Artificial Intelligence, UNIST(蔚山科学技术院人工智能研究生院)

AI总结 本文提出首个结合视觉信息的电影音频源分离框架AV-CASS,通过条件流匹配实现多模态音频分离,并设计专用视觉编码器提升分离质量。

Comments CVPR 2026. Project page: https://cass-flowmatching.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26096 2026-03-30 cs.LG cs.CV

AcTTA: Rethinking Test-Time Adaptation via Dynamic Activation

AcTTA:通过动态激活重新思考测试时间适应

Hyeongyu Kim, Geonhui Han, Dosik Hwang

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术研究院)

AI总结 本文提出AcTTA框架,通过动态调整激活函数提升测试时间适应鲁棒性,在多个数据集上优于传统归一化方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26092 2026-03-30 cs.CV cs.LG

CD-Buffer: Complementary Dual-Buffer Framework for Test-Time Adaptation in Adverse Weather Object Detection

CD-Buffer:互补双缓冲框架用于恶劣天气目标检测中的测试时适应

Youngjun Song, Hyeongyu Kim, Dosik Hwang

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术研究院)

AI总结 本文提出CD-Buffer框架,通过互补的减法与加法机制,在不同天气条件下自动平衡测试时适应策略,提升目标检测性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26078 2026-03-30 cs.CV cs.AI

When Identities Collapse: A Stress-Test Benchmark for Multi-Subject Personalization

当身份崩溃时:多主体个性化的一个压力测试基准

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一个压力测试基准,揭示多主体生成模型在复杂场景下的身份崩溃问题,并引入新的评估指标SCR,强调未来生成架构需显式物理解耦。

Comments 10 pages, 7 figures, accepted by CVPR 2026 Workshop P13N

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26071 2026-03-30 cs.CV cs.LG

MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality

MUST:一种模态特定表示感知的Transformer,用于具有缺失模态的扩散增强生存预测

Kyungwon Kim, Dosik Hwang

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术研究院)

AI总结 MUST通过分解模态特定和跨模态上下文化组件,提高生存预测的准确性,在缺失模态情况下仍能保持稳健预测。

Comments Accepted to CVPR 2026. 10 pages, 5 figures, supplementary included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26055 2026-03-30 cs.CV

Pioneering Perceptual Video Fluency Assessment: A Novel Task with Benchmark Dataset and Baseline

开创性视频流畅度评估:一种新任务及其基准数据集和基线

Qizhi Xie, Kun Yuan, Yunpeng Qu, Ming Sun, Chao Zhou, Jihong Zhu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 本文提出视频流畅度评估(VFA)作为独立任务,构建了面向流畅度的数据集FluVid,并开发了包含23种方法的基准,提出FluNet模型通过时间排列自注意力提升流畅度信息。

Comments 14 pages, 6 figures. Accepted by CVPR 2026 findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26052 2026-03-30 cs.CV cs.AI

Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification

像素与词语之间的桥梁:面向多模态媒体验证的掩码感知局部语义融合

Zizhao Chen, Ping Wei, Ziyang Ren, Huan Li, Xiangru Yin

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

AI总结 本文提出MaLSF框架,通过主动双向验证和层次语义聚合模块,解决多模态虚假信息检测中的局部语义不一致问题,实现像素与词语的语义连接。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22687 2026-03-30 cs.CV

GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning

GeoTikzBridge:推动多模态代码生成在几何感知与推理中的发展

Jiayin Sun, Caixia Sun, Boyu Yang, Hailin Li, Xiao Chen, Yi Zhang, Errui Ding, Liang Li, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(九天研究院)

AI总结 本文提出GeoTikzBridge框架,通过基于tikz的代码生成提升局部几何感知和视觉推理能力,利用两个互补数据集训练模型,实现多模态大语言模型在几何问题解决中的先进性能。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21077 2026-03-30 cs.CV

CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models

CoVFT:面向多模态大语言模型的上下文感知视觉微调

Nan Zhou, Huiqun Wang, Yaoyan Zheng, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文提出CoVFT框架,通过整合上下文向量提取和上下文混合专家模块,解决多模态任务中视觉微调的不稳定性问题,实现更稳定的视觉更新。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12760 2026-03-30 cs.CV

HIFICL: High-Fidelity In-Context Learning for Multimodal Tasks

HIFICL:多模态任务的高保真上下文学习

Xiaoyu Li, Yuhang Liu, Xuanshuo Kang, Zheng Luo, Fangqi Lou, Xiaohua Wu, Zihan Xiong

机构 * University of Electronic Science and Technology of China(电子科技大学) Institute of Electronics and Information Industry Technology of Kashgar(喀什电子信息产业技术研究院)

AI总结 HIFICL通过引入虚拟键值对、低秩分解和端到端训练目标,改进多模态任务的上下文学习机制,实验表明其在多个基准上优于现有近似方法。

Comments Accepted to CVPR 2026. Code available at https://github.com/bbbandari/HiFICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06178 2026-03-30 cs.CV

Making Training-Free Diffusion Segmentors Scale with the Generative Power

利用生成能力使免训练扩散分割器扩展

Benyuan Meng, Qianqian Xu, Zitai Wang, Xiaochun Cao, Longtao Huang, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Cyber Science and Tech., Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Alibaba Group(阿里巴巴集团) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Key Laboratory of Big Data Mining and Knowledge Management, CAS(中国科学院大数据挖掘与知识管理重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文研究了如何通过提升扩散模型的生成能力来改进免训练的图像分割方法,提出自动聚合和像素级重缩放技术以解决注意力图与全局表示不一致及文本标记间得分不平衡的问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00717 2026-03-30 cs.CV

Leveraging Arbitrary Data Sources for AI-Generated Image Detection Without Sacrificing Generalization

利用任意数据源进行AI生成图像检测而不牺牲泛化能力

Qinghui He, Haifeng Zhang, Xiuli Bi, Bo Liu, Chi-Man Pun, Bin Xiao

机构 * Chongqing Key Laboratory of Image Cognition, Chongqing University of Posts and Telecommunications(重庆邮电大学图像认知重庆市重点实验室) School of Computer Science and Technology(计算机科学与技术学院) School of Artificial Intelligence(人工智能学院) University of Macau(澳门大学) Jinan Inspur Data Technology Co., Ltd.(济南浪潮数据技术有限公司)

AI总结 本文提出一种单类属性建模框架,通过构建紧凑的属性空间增强真实与生成图像的差异,提升跨模型泛化能力,实验表明在准确率和跨模型泛化上优于现有检测器。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22949 2026-03-30 cs.CV

OpenFS: Multi-Hand-Capable Fingerspelling Recognition with Implicit Signing-Hand Detection and Frame-Wise Letter-Conditioned Synthesis

OpenFS: 多手能力的指字母识别与隐式手部检测及帧级字母条件合成

Junuk Cha, Jihyeon Kim, Han-Mu Park

机构 * KAIST(韩国科学技术院) KETI(韩国电子技术研究院)

AI总结 本文提出OpenFS,通过隐式手部检测和帧级字母条件合成解决指字母识别中的手部歧义、训练损失不足和词汇外问题,实现单手和多手输入的高精度识别与合成。

Comments Accepted to CVPR 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22025 2026-03-30 cs.CV

Olbedo: An Albedo and Shading Aerial Dataset for Large-Scale Outdoor Environments

Olbedo:一个用于大规模户外环境的反光与阴影数据集

Shuang Song, Debao Huang, Deyan Deng, Haolin Xiong, Yang Tang, Yajie Zhao, Rongjun Qin

机构 * The Ohio State University(俄亥俄州立大学) University of Southern California(南加州大学) Institute for Creative Technologies(创意技术研究所)

AI总结 Olbedo数据集通过多视角一致的反光和阴影地图等标注,使基于合成数据训练的扩散模型在真实户外场景中实现更优的内在图像分解性能,支持3D资产光照一致重映射和城市数字孪生分析。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19530 2026-03-30 cs.CV

ORION: ORthonormal Text Encoding for Universal VLM AdaptatION

ORION:用于通用视觉语言模型适应的正交文本编码

Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

机构 * ÉTS Montréal, Canada(蒙特利尔高等技术学院(加拿大))

AI总结 ORION通过低秩适应优化正交损失,提升预训练VLM的文本嵌入质量,实验表明其在多个基准上显著提升性能。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18846 2026-03-30 cs.CV cs.AI

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

DUET-VLM:双阶段统一高效令牌减少用于VLM训练和推理

Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(超威半导体公司(AMD))

AI总结 DUET-VLM通过双阶段令牌压缩框架,在保持语义的同时显著减少视觉令牌数量,实现高效训练和推理。

Comments 15 Pages, 8 figures, 15 tables, CVPR 2026; Code: AGI/DUET-VLM" target="_blank" rel="noopener">https://github.com/AMD-AGI/DUET-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17468 2026-03-30 cs.CV cs.LG

ReflexSplit: Single Image Reflection Separation via Layer Fusion-Separation

ReflexSplit:通过层融合-分离实现单图像反射分离

Chia-Ming Lee, Yu-Fan Lin, Jin-Hui Jiang, Yu-Jou Hsiao, Chih-Chung Hsu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Cheng Kung University(国立成功大学)

AI总结 本文提出ReflexSplit框架,通过跨尺度门控融合、层融合-分离模块和课程学习方法,解决单图像反射分离中的传输-反射混淆问题,实现更高质量的分离效果。

Comments CVPR 2026 Camera Ready; Project page: https://wuw2135.github.io/ReflexSplit-ProjectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏