The Eleventh NTIRE 2026 Efficient Super-Resolution Challenge Report
2026年NTIRE高效超分辨率挑战赛报告
AI总结 本文回顾了2026年NTIRE高效单幅图像超分辨率挑战赛,总结了参赛方案与结果,旨在设计保持PSNR性能的高效网络。
Comments CVPR 2026 NTIRE Workshop Paper, Efficient Super Resolution Technical Report
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
2026年NTIRE高效超分辨率挑战赛报告
AI总结 本文回顾了2026年NTIRE高效单幅图像超分辨率挑战赛,总结了参赛方案与结果,旨在设计保持PSNR性能的高效网络。
Comments CVPR 2026 NTIRE Workshop Paper, Efficient Super Resolution Technical Report
理解强化学习在多模态推理模型后训练中幻觉的作用
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Science and Technology of China(中国科学技术大学) ; Arizona State University(亚利桑那州立大学) ; Honda Research Institute, USA(本田美国研究所)
AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。
Comments CVPR 2026
SparseSplat: 向可应用的前馈3D高斯点划法迈进:像素不齐预测
机构 * Fudan University(复旦大学) ; ShanghaiTech University(上海科技大学)
AI总结 本文提出SparseSplat,首个可适应场景结构和局部区域信息丰富度的前馈3D高斯点划法模型,生成紧凑的3DGS地图,实验表明其在22%和1.5%的高斯数量下均能获得优异渲染质量。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
通过基于溯源的输入梯度引导学习合成数据
机构 * Keio University(庆应义塾大学) ; Independent Researcher(独立研究员) ; CyberAgent
AI总结 本文提出利用训练数据合成过程中的溯源信息作为辅助监督信号,通过分解输入梯度抑制非目标区域,提升模型对目标区域的判别能力,验证了方法在多任务和多模态中的有效性。
Comments CVPR 2026
UniSpector:通过频谱-对比视觉提示实现通用开放集缺陷识别
机构 * LG Energy Solution(LG新能源)
AI总结 UniSpector通过设计语义结构化的提示拓扑,解决工业检测中开放集缺陷识别的问题,其在AP50b和AP50m上优于基线19.7%和15.8%。
Comments Accepted to CVPR 2026
解锁增量学习手术仪器中的正向迁移:一种自反思分层提示框架
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Electronic Science and Technology of China(电子科技大学)
AI总结 本文提出自反思分层提示框架,通过正向和反向知识迁移提升手术仪器增量分割性能,改进现有技能并避免灾难性遗忘。
Comments Accepted by CVPR 2026
令牌扭曲帮助多模态大语言模型从近处视角观察
机构 * KAIST(韩国科学技术院)
AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。
Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io
范式转变:面向视频中的时序句子定位的端到端训练
机构 * BASIS International School Park Lane Harbour(贝赛思国际学校(公园港)) ; UCAS(中国科学院大学) ; JD Explore Academy(京东探索研究院) ; USTC(中国科学技术大学)
AI总结 本文提出一种端到端训练范式,联合优化视频主干网络和定位头,通过引入Sentence Conditioned Adapter提升视觉表征,实验表明优于现有方法。
Comments Accepted as CVPR 2026 Workshop PVUW
基于变形的点云情境学习
机构 * Shenzhen Institute for Advanced Study, UESTC(电子科技大学深圳高等研究院) ; School of Computer Science and Engineering, UESTC(电子科技大学计算机科学与工程学院) ; Sichuan University(四川大学)
AI总结 本文提出DeformPIC框架,通过任务引导变形查询点云以实现点云情境学习,改进几何推理和一致性目标,实验显示在重建、去噪和配准任务中均优于现有方法。
Comments Accepted by CVPR 2026. Code: https://github.com/linchengxing/DeformPIC
视觉模型中对抗性成员操纵的统一视角
机构 * Knowin AI ; The Chinese University of Hong Kong(香港中文大学) ; The University of Melbourne(墨尔本大学)
AI总结 本文探讨了视觉模型中对抗性成员操纵现象,揭示其几何特征并提出检测与防御策略,提升模型鲁棒性。
Comments Accepted by CVPR 2026
MOMO:用于火星轨道应用的火星轨道基础模型
机构 * Arizona State University(亚利桑那州立大学) ; Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室)
AI总结 MOMO是首个多传感器基础模型,通过模型融合整合来自HiRISE、CTX和THEMIS三种关键火星传感器的数据,提升多分辨率数据的稳定性和泛化能力。
Comments Accepted at CVPR 2026 (Main Track)
具有抗漂移特性的时序先验用于视觉跟踪
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Pengcheng Laboratory(鹏城实验室) ; Lero, the Research Ireland Centre for Software, University of Limerick(Lero,爱尔兰软件研究中心,利默里克大学) ; Pazhou Lab (Huangpu)(琶洲实验室(黄埔))
AI总结 本文提出DTPTrack模块,通过时序可靠性校准和时序指导合成方法,提升多帧跟踪器的抗漂移能力,在三个不同架构上均取得显著性能提升。
Comments accepted by CVPR 2026
解锁多站点临床数据:一种以隐私为中心的联邦学习方法用于儿童自闭症行为分析
机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) ; Department of Clinical Sciences, College of Medicine, University of Central Florida(中佛罗里达大学医学院临床科学系) ; Department of Computer Science, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校计算机科学系) ; Department of Computer Science, Northern Illinois University(北伊利诺伊大学计算机科学系) ; Industrial and Systems Engineering, Northern Illinois University(北伊利诺伊大学工业与系统工程系)
AI总结 本文提出利用联邦学习进行基于姿态的儿童自闭症行为识别,通过隐私保护机制和多站点数据协作,实现高准确率的隐私优先解决方案。
Comments Accepted on the CVPR 2026 Workshop on Computer Vision for Children (CV4CHL)
音频视觉大语言模型真的能看见和听见吗?
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。
Comments CVPR Findings
Rascene:利用毫米波通信信号实现高保真3D场景成像
机构 * Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)
AI总结 本文提出Rascene框架,利用毫米波通信信号实现高精度3D场景成像,克服了传统传感器在恶劣环境下的局限性,提供了一种低成本、可扩展的3D感知新途径。
Comments Accepted to CVPR 2026
特征归因稳定性套件:后验归因的稳定性如何?
机构 * The George Washington University(乔治华盛顿大学)
AI总结 本文提出FASS基准,通过预测不变过滤分解稳定性为结构相似度、排名相关性和top-k Jaccard重叠,评估四种归因方法在不同扰动下的稳定性,发现几何扰动比光度扰动更具不稳定性。
Comments Accepted in the proceedings track of XAI4CV Workshop at CVPR 2026. It has 2 images, 5 tables, 6 equations, and 35 references in the main paper and 12 figures, 15 tables, and 3 references in the supplementary material
野外场景的场景定位
机构 * Tel Aviv University(特拉维夫大学) ; Cornell University(康奈尔大学)
AI总结 本文提出一种框架,通过将部分重建与完整的参考模型对齐,提升无视觉重叠时的大尺度场景重建一致性。方法基于伪合成渲染,利用3D高斯点云和逆特征优化,引入WikiEarth数据集验证效果。
Comments CVPR 2026. Project page at https://tau-vailab.github.io/SceneGround/
基于基础模型对齐的生成事件预训练
机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人感知组)
AI总结 本文提出GEP框架,通过将互联网级图像数据集中的语义知识迁移到事件数据,并学习事件特有的时间动态,提升事件视觉基础模型在跨任务迁移学习中的性能。
Journal ref CVPR 2026 Findings
当否定是在视觉-语言模型中一个几何问题
机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO系) ; imec ; Independent Researcher(独立研究员)
AI总结 本文探讨了视觉-语言模型中否定理解的几何问题,提出基于多模态大语言模型的评估框架,并通过表示工程操控CLIP模型实现否定意识。
Comments Accepted to CVPR (Multimodal Algorithmic Reasoning Workshop) 2026
DiFlowDubber:通过跨模态对齐与同步实现的离散流匹配自动化视频配音
机构 * FPT Software AI Center, Vietnam(FPT软件人工智能中心,越南) ; KAIST, South Korea(韩国科学技术院) ; University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校)
AI总结 本文提出DiFlowDubber框架,通过离散流匹配和两阶段训练策略,解决视频配音中内容准确性、表达语气、高质量音频和精确唇同步的问题。
Comments Accepted at CVPR 2026 Findings
带有双先验的文本-相位协同网络用于无监督跨域图像检索
机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))
AI总结 本文提出TPSNet,通过结合文本先验和相位先验,提升无监督跨域图像检索性能。
Comments Accepted by CVPR 2026
ReWeaver:面向仿真准备和拓扑准确的服装重建
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学) ; Fudan University(复旦大学) ; Adobe ; Xidian University(西安电子科技大学)
AI总结 ReWeaver通过稀疏多视角图像实现拓扑准确的3D服装和缝纫图案重建,提升仿真和机器人应用的精度与一致性。
Comments Accepted to CVPR 2026
保留源视频真实性:面向电影质量的高保真面部交换
机构 * Zhejiang University, State Key Laboratory of CAD & CG(浙江大学,计算机辅助设计与图形学国家重点实验室) ; Zhejiang University of Technology(浙江工业大学) ; Ant Group(蚂蚁集团)
AI总结 本文提出LivingSwap模型,通过关键帧和视频参考引导实现高保真面部交换,提升视频真实感与时间一致性,减少生产流程中的手动工作量。
Comments Accepted to CVPR 2026. Project webpage: https://aim-uofa.github.io/LivingSwap
通过视频扩散模型实现目标驱动的奖励用于强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) ; Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) ; Zhongguancun Academy(中关村学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)
AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。
Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward
FACT-GS:频率对齐的复杂度感知纹理重参数化用于2D高斯点划法
机构 * Concordia University(康考迪亚大学) ; Mila–Quebec AI Institute(Mila-魁北克人工智能研究所)
AI总结 FACT-GS通过根据局部视觉频率分配纹理采样密度,提高2D高斯点划法的纹理空间利用效率,实现更清晰的高频细节表现。
Comments 11 pages, 6 figures, CVPR 2026 Findings track. Project page: https://tianhaoxie.github.io/project/FACT-GS/
更多更好:用于高阶多模态对齐的对比融合
机构 * Foundation for Research and Technology-Hellas(希腊研究与技术基金会) ; University of Crete(克里特大学) ; KU Leuven(鲁汶大学)
AI总结 本文提出对比融合框架,通过联合嵌入个体模态及其融合组合,捕捉高阶依赖关系,提升多模态对齐效果。
Comments Accepted to CVPR 2026
视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析
机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)
AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。
Comments Accepted at COGVL Workshop at CVPR 2026
基于神经场的多探测器信号扫描电子显微镜微结构三维表面重建
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ; Alibaba Group(阿里巴巴集团) ; Analysis Center of Agriculture, Life and Environment Sciences, Zhejiang University(浙江大学农业、生命与环境科学分析中心)
AI总结 本文提出NFH-SEM框架,利用神经场整合多视图几何与探测器信号光度立体线索,实现高保真三维表面重建,展示了在不同材料上的精确恢复能力。
Comments CVPR 2026