arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2604.07198 2026-04-09 cs.LG cs.ET

Beyond the Mean: Modelling Annotation Distributions in Continuous Affect Prediction

超越均值:在连续情感预测中建模注释分布

Kosmas Pinitas, Ilias Maglogiannis

AI总结 本文提出了一种基于Beta分布的框架,用于建模注释共识,以捕捉情感感知的中心趋势、变异性、不对称性和不确定性。

Comments This paper has been accepted at the CVPR 2026 Workshop on Affective Behavior Analysis in-the-wild (ABAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07193 2026-04-09 cs.CL cs.ET

LaScA: Language-Conditioned Scalable Modelling of Affective Dynamics

LaScA:语言条件下的可扩展情感动态建模

Kosmas Pinitas, Ilias Maglogiannis

机构 * University of Piraeus(比雷埃夫斯大学)

AI总结 本文提出LaScA框架,利用语言模型作为语义上下文条件器,结合手工制作的情感描述符建模情感变化,通过可解释的面部和声音特征提升预测准确性。

Comments This paper has been accepted at the CVPR 2026 Workshop on Affective Behavior Analysis in-the-wild (ABAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07166 2026-04-09 cs.CV cs.HC cs.LG

DINO-QPM: Adapting Visual Foundation Models for Globally Interpretable Image Classification

DINO-QPM:为全球可解释的图像分类适应视觉基础模型

Robert Zimmermann, Thomas Norrenbrock, Bodo Rosenhahn

机构 * Institute for Information Processing, L3S - Leibniz University Hannover(信息处理研究所,L3S - 莱布尼茨汉诺威大学)

AI总结 DINO-QPM通过将复杂特征转换为可解释的对比表示,提升图像分类的可解释性,同时在准确性和解释质量上优于DINOv2线性探针。

Comments Accepted to the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07132 2026-04-09 cs.CV cs.AI cs.LG

CSA-Graphs: A Privacy-Preserving Structural Dataset for Child Sexual Abuse Research

CSA-Graphs: 一种保护隐私的结构数据集用于儿童性虐待研究

Carlos Caetano, Camila Laranjeira, Clara Ernesto, Artur Barros, João Macedo, Leo S. F. Ribeiro, Jefersson A. dos Santos, Sandra Avila

机构 * Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学) Instituto Federal de Educação, Ciência e Tecnologia de Minas Gerais (IFMG)(米纳斯吉拉斯联邦教育、科学和技术研究所) Universidade de São Paulo (USP)(圣保罗大学) Universidade Federal de Minas Gerais (UFMG)(米纳斯吉拉斯联邦大学) Polícia Federal (PF)(联邦警察) University of Sheffield(谢菲尔德大学)

AI总结 本文提出CSA-Graphs数据集,通过结构化表示替代原始图像,保留上下文信息以实现儿童性虐待图像分类,同时遵守法律和伦理限制。

Comments Conference on Computer Vision and Pattern Recognition (CVPR 2026), in the Workshop on Computer Vision for Children (CV4CHL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02945 2026-04-09 cs.CL

ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation

ACE-Merging:无数据模型融合与自适应协方差估计

Bo Xu, Haotian Wu, Hehai Lin, Weiquan Huang, Beier Zhu, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出ACE-Merging方法,通过自适应协方差估计实现无数据模型融合,解决专家模型间干扰问题,实验表明其在视觉和语言基准上优于现有方法。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01558 2026-04-09 cs.CV

TopoMaskV3: 3D Mask Head with Dense Offset and Height Predictions for Road Topology Understanding

TopoMaskV3:用于道路拓扑理解的3D掩码头:具有密集偏移和高度预测

Muhammet Esat Kalfaoglu, Halil Ibrahim Ozturk, Ozsel Kilinc, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(中东技术大学信息学研究生院) Togg/Trutek AI Team(Togg/Trutek 人工智能团队)

AI总结 TopoMaskV3通过引入密集偏移场和高度图,实现了3D道路拓扑理解的稳健预测,同时解决了地理数据泄露问题,取得了新的性能突破。

Comments Accepted to CVPR 2026 Workshops (AUTOPILOT 2026): 3rd Workshop on Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21105 2026-04-09 cs.CV

BrepGaussian: CAD reconstruction from Multi-View Images with Gaussian Splatting

BrepGaussian:从多视角图像中通过高斯点划进行CAD重建

Jiaxing Yu, Dongyang Ren, Hangyu Xu, Zhouyuxiao Yang, Yuanqi Li, Jie Guo, Zhengkang Zhou, Yanwen Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Nanjing Urban Construction Tunnel& Bridge Intelligent Management Co., Ltd.(南京城建隧道桥梁智能管理有限公司)

AI总结 本文提出BrepGaussian框架,通过学习2D图像中的3D参数化表示,实现从多视角图像中重建CAD模型,其核心方法是结合可学习特征的高斯点划渲染器和特定拟合策略,有效分离了几何重建与特征学习。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15599 2026-04-09 cs.CV

FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervision

FlexAvatar:通过部分监督学习完整的3D头像

Tobias Kirschstein, Simon Giebenhain, Matthias Nießner

机构 * Technical University of Munich(慕尼黑工业大学)

AI总结 FlexAvatar通过结合单目和多视角数据,解决单目数据不足和多视角数据获取困难的问题,实现高质量的3D头像生成。

Comments Accepted to CVPR 2026, Project website: https://tobias-kirschstein.github.io/flexavatar/ , Video: https://youtu.be/g8wxqYBlRGY

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06581 2026-04-09 cs.CV

MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding

MedGRPO:异构医学视频理解的多任务强化学习

Yuhao Su, Anwesa Choudhuri, Zhongpai Gao, Benjamin Planche, Van Nguyen Nguyen, Meng Zheng, Yuhan Shen, Arun Innanje, Terrence Chen, Ehsan Elhamifar, Ziyan Wu

机构 * Northeastern University(东北大学) United Imaging Intelligence(联影智能)

AI总结 本文提出MedGRPO框架,通过跨数据集奖励归一化和医学LLM评判器提升医学视频理解的训练效果,建立基础基准和训练方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06129 2026-04-08 cs.CV cs.AI

PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer

PoM:一种线性时间的注意力替代方案:多项式混合器

David Picard, Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Davide Allegro, Tom Ravaud, Yohann Perron, Corentin Sautier, Zeynep Sonat Baltaci, Fei Meng, Syrine Kalleli, Marta López-Rauhut, Thibaut Loiseau, Ségolène Albouy, Raphael Baena, Elliot Vincent, Loic Landrieu

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM,法国国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎高科路桥学院,巴黎综合理工学院) LIX, École Polytechnique, CNRS, IP Paris(LIX,巴黎综合理工学院,法国国家科学研究中心,巴黎综合理工学院) Department of Information Engineering, Università degli Studi di Padova(帕多瓦大学信息工程系) AMIAD, Pole recherche, EFEO(AMIAD,法国远东学院研究部) LASTIG, Univ Gustave Eiffel, IGN, Géodata Paris(LASTIG,古斯塔夫·埃菲尔大学,法国国家地理与森林信息研究所,巴黎地理数据)

AI总结 本文提出PoM,一种线性复杂度的替代注意力机制,通过学习多项式函数聚合输入令牌,实现高效序列处理,减少长序列计算成本。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06099 2026-04-08 cs.CV

Extending ZACH-ViT to Robust Medical Imaging: Corruption and Adversarial Stress Testing in Low-Data Regimes

扩展ZACH-ViT以实现鲁棒医学影像:在低数据环境下对损坏和对抗性压力测试

Athanasios Angelakis, Marta Gomez-Barrero

机构 * BioML Lab, RI CODE, UniBw, Munich, Germany(慕尼黑联邦国防军大学,RI CODE,BioML实验室,德国慕尼黑) AUMC, Amsterdam, Netherlands(阿姆斯特丹大学医学中心,荷兰阿姆斯特丹)

AI总结 本文扩展ZACH-ViT,评估其在低数据环境下对常见图像损坏和对抗扰动的鲁棒性,发现其在清洁数据和常见损坏下表现优异,在对抗性压力下仍保持竞争力,但对抗鲁棒性仍是挑战。

Comments Accepted at CVPR 2026 Workshop (PHAROS-AIF-MIH)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22844 2026-04-08 cs.AI

PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal

PhySe-RPO:物理与语义引导的相对策略优化用于基于扩散的手术烟雾去除

Zining Fang, Cheng Xue, Chunhui Liu, Bin Xu, Ming Chen, Xiaowei Hu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

AI总结 本文提出PhySe-RPO框架,通过物理和语义引导的相对策略优化,解决手术烟雾去除中配对监督不足的问题,实现物理一致、语义忠实且临床可解释的扩散修复。

Comments 12 pages,7figures,published to CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18601 2026-04-08 cs.GR cs.AI cs.CV cs.LG

BulletGen: Improving 4D Reconstruction with Bullet-Time Generation

BulletGen: 通过子弹时间生成提升4D重建

Denis Rozumny, Jonathon Luiten, Numair Khan, Johannes Schönberger, Peter Kontschieder

机构 * Meta Reality Labs(Meta 现实实验室)

AI总结 BulletGen利用生成模型在Gaussian动态场景表示中校正错误并补全缺失信息,通过对扩散视频生成模型输出与4D重建在单个冻结子弹时间步骤的对齐,实现新颖视角合成和2D/3D跟踪任务的最先进结果。

Comments Accepted at CVPR 2026 Workshop "4D World Models: Bridging Generation and Reconstruction"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05780 2026-04-08 cs.CV

Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion

稀疏感知体素注意力与前景调节用于3D语义场景补全

Yu Xue, Longjun Gao, Yuanqi Su, HaoAng Lu, Xiaoning Zhang

AI总结 本文提出VoxSAMNet,通过稀疏感知和语义引导设计,解决单目语义场景补全中体素分布不平衡和泛化能力差的问题,实现更高效准确的3D场景补全。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05748 2026-04-08 cs.CV

SVC 2026: the Second Multimodal Deception Detection Challenge and the First Domain Generalized Remote Physiological Measurement Challenge

SVC 2026: 第二届多模态欺骗检测挑战赛及首个领域通用远程生理测量挑战

Dongliang Zhu, Zhiyi Niu, Bo Zhao, Jiajian Huang, Shuo Ye, Xun Lin, Hui Ma, Taorui Wang, Jiayu Zhang, Chunmei Zhu, Junzhe Cao, Yingjie Ma, Rencheng Song, Albert Clapés, Sergio Escalera, Dan Guo, Zitong Yu

机构 * Wuhan University(武汉大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Hefei University of Technology(合肥工业大学) University of Barcelona(巴塞罗那大学)

AI总结 本文提出SVC 2026挑战赛,旨在通过多模态欺骗检测和远程脉搏波测速估计任务,推动对细微视觉信号的鲁棒表示学习研究。

Comments Accepted by the SVC workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05730 2026-04-08 cs.LG

Controllable Image Generation with Composed Parallel Token Prediction

通过组合并行令牌预测实现可控图像生成

Jamie Stirling, Noura Al-Moubayed, Chris G. Willcocks, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,相比现有方法在误差率和FID上均有显著提升,并实现高效的文本到图像生成控制。

Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF). arXiv admin note: substantial text overlap with arXiv:2405.06535

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05724 2026-04-08 cs.CV

Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP

超越语义:在稀疏自编码器中解构信息范围以用于CLIP

Yusung Ro, Jaehyun Choi, Junmo Kim

机构 * KAIST(韩国科学技术院) Korea AI Safety Institute, ETRI(韩国电子通信研究院人工智能安全研究所)

AI总结 本文提出信息范围作为理解CLIP表示的新维度,通过Contextual Dependency Score量化稀疏自编码器特征的广度,揭示不同信息范围特征对CLIP预测和置信度的影响差异。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05721 2026-04-08 cs.CV

GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidance

GaussianGrow:基于3D点云与文本引导的几何感知Gaussian生成

Weiqi Zhang, Junsheng Zhou, Haotian Geng, Kanle Shi, Shenkun Xu, Yi Fang, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Kuaishou Technology(快手科技) CAIR and CIDSAI, NYU Abu Dhabi(纽约大学阿布扎比分校CAIR和CIDSAI)

AI总结 本文提出GaussianGrow,通过学习从3D点云中生长Gaussian,结合多视角扩散模型和文本引导,提升生成几何精度与质量。

Comments Accepted by CVPR 2026. Project page: https://weiqi-zhang.github.io/GaussianGrow

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05715 2026-04-08 cs.CV

In Depth We Trust: Reliable Monocular Depth Supervision for Gaussian Splatting

深入信赖:为高斯散射可靠的单目深度监督

Wenhui Xiao, Ethan Goan, Rodrigo Santa Cruz, David Ahmedt-Aristizabal, Olivier Salvado, Clinton Fookes, Leo Lebrat

机构 * Queensland University of Technology(昆士兰科技大学)

AI总结 本文提出一种整合模糊和噪声深度先验的训练框架,以提升高斯散射的几何监督,从而提高渲染质量。

Comments accepted to CVPR 3DMV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05524 2026-04-08 cs.CV

Cross-Resolution Diffusion Models via Network Pruning

通过网络剪枝实现跨分辨率扩散模型

Jiaxuan Ren, Junhan Zhu, Huan Wang

机构 * Westlake University(西湖大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出CR-Diff方法,通过参数剪枝提升扩散模型在不同分辨率下的视觉一致性,保持默认分辨率性能,支持提示特定优化。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05497 2026-04-08 cs.AI cs.CV

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

Thinking Diffusion: 通过惩罚和引导在扩散多模态语言模型中抑制和引导视觉推理

Keuntae Kim, Mingyu Kang, Yong Suk Choi

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系)

AI总结 本文针对扩散多模态语言模型在视觉推理中生成过早答案的问题,提出位置与步数惩罚和视觉推理引导方法,提升推理准确率并加快推理速度。

Comments CVPR 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05436 2026-04-08 cs.CV cs.AI

Human Interaction-Aware 3D Reconstruction from a Single Image

面向人类交互的单图像三维重建

Gwanghyun Kim, Junghun James Kim, Suh Yoon Jeon, Jason Park, Se Young Chun

机构 * Seoul National University(首尔大学)

AI总结 本文提出HUG3D框架,通过建模群体和实例级信息,解决多人类场景中的几何失真和交互问题,实现高保真三维重建。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05393 2026-04-08 cs.CV cs.MM

Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval

超越语义检索:面向组合图像检索的指代锚定

Yuxin Yang, Yinan Zhou, Yuxin Chen, Ziqi Zhang, Zongyang Ma, Chunfeng Yuan, Bing Li, Jun Gao, Weiming Hu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Inc.(腾讯公司) PeopleAI Inc.(人民人工智能公司) HelloGroup Inc.(哈啰集团) ShanghaiTech University(上海科技大学)

AI总结 本文提出OACIR任务,通过引入对象锚定机制提升组合图像检索的实例一致性,构建了包含16万多个四元组的OACIRR基准,采用AdaFocal框架实现动态关注平衡,实验表明其在保持实例一致性方面表现优异。

Comments Accepted to CVPR 2026. Project page, dataset, and code are available at: https://hahajun1101.github.io/OACIR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05316 2026-04-08 cs.CV

Indoor Asset Detection in Large Scale 360° Drone-Captured Imagery via 3D Gaussian Splatting

通过3D高斯散射实现大规模360°无人机拍摄影像中的室内资产检测

Monica Tang, Avideh Zakhor

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文提出一种基于3D高斯散射的室内资产检测方法,通过结合掩码语义和空间信息,提升多视角掩码关联和检测精度,实验显示在两个大型室内场景中,F1分数提升65%,mAP提升11%。

Comments Accepted to CVPR 2026 3DMV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05171 2026-04-08 cs.CV cs.AI

Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI

多模态脑MRI的模态感知与解剖矢量量化自编码

Mingjie Li, Edward Kim, Yue Zhao, Ehsan Adeli, Kilian M. Pohl

机构 * Stanford University(斯坦福大学)

AI总结 本文提出NeuroQuant,一种基于模态感知和解剖学的3D矢量量化自编码器,用于多模态脑MRI重建,通过共享潜在表示和双流编码提升重建精度。

Comments CVPR Fingdings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04576 2026-04-08 cs.CV

PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis

PR-IQA:基于扩散模型的新型视角合成的部分参考图像质量评估

Inseong Choi, Siwoo Lee, Seung-Hun Nam, Soohwan Song

机构 * Dongguk University(东国大学) NAVER WEBTOON AI

AI总结 PR-IQA通过部分参考图像评估扩散生成的视角合成图像质量,提升3D重建效果,无需真实地面真值。

Comments Accepted at CVPR 2026. Project Page: https://kakaomacao.github.io/pr-iqa-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00503 2026-04-08 cs.CV

PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training

PET-DINO:将视觉线索统一到Grounding DINO中通过提示增强训练

Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang

机构 * YouTu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技可灵团队)

AI总结 PET-DINO通过提示增强训练策略,统一视觉线索到Grounding DINO中,提升零样本目标检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26481 2026-04-08 cs.CV

SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras

SparseCam4D:从稀疏摄像机进行时空一致的4D重建

Weihong Pan, Xiaoyu Zhang, Zhuang Zhang, Zhichao Ye, Nan Wang, Haomin Liu, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) InSpatio Research

AI总结 本文提出一种基于稀疏摄像机的动态重建框架,通过建模生成观测中的时空不一致性和开发完整流程,实现高保真4D重建并显著优于现有方法。

Comments CVPR 2026. Project page: https://inspatio.github.io/sparse-cam4d/ and code: https://github.com/inspatio/sparse-cam4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11680 2026-04-08 cs.CV

UCAN: Unified Convolutional Attention Network for Expansive Receptive Fields in Lightweight Super-Resolution

UCAN:统一的卷积注意力网络用于轻量超分辨率中的扩展感受野

Cao Thien Tan, Phan Thi Thu Trang, Do Nghiem Duc, Ho Ngoc Anh, Hanyang Zhuang, Nguyen Duc Dung

机构 * Ho Chi Minh City Open University(胡志明市开放大学) AI Tech Lab, Ho Chi Minh City University of Technology(胡志明市科技大学人工智能技术实验室) Code Mely AI Research Team(Code Mely 人工智能研究团队) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Ha Noi University of Science and Technology(河内科技大学) University of Manitoba(曼尼托巴大学)

AI总结 UCAN通过融合卷积与注意力机制,有效扩展感受野,采用Hedgehog注意力和蒸馏模块实现高效轻量化,适用于资源受限设备的超分辨率恢复。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏