HarmoVid: Relightful Video Portrait Harmonization
HarmoVid: 可重光照的视频人像协调
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Adobe Research(Adobe研究)
AI总结 提出一种基于视频扩散模型和光照去闪烁方法,实现前景视频与目标背景场景在阴影、色调和光照强度上的协调,解决视频时域抖动问题。
Comments CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
HarmoVid: 可重光照的视频人像协调
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Adobe Research(Adobe研究)
AI总结 提出一种基于视频扩散模型和光照去闪烁方法,实现前景视频与目标背景场景在阴影、色调和光照强度上的协调,解决视频时域抖动问题。
Comments CVPR 2026
可变形高斯占据:通过分解蒸馏解耦刚性与非刚性运动
机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑校区)
AI总结 提出DeGO框架,通过解耦高斯变形和分解式4D基础模型蒸馏,在弱监督下实现动态场景中刚性与非刚性运动的分离,显著提升人体实例占据预测性能。
Comments CVPR 2026
通过无训练图拉普拉斯能量最小化的非一致性异常检测
机构 * Dept. of Artificial Intelligence, Hanyang University(人工智能系,翰阳大学) ; Dept. of Data Science, Hanyang University(数据科学系,翰阳大学) ; Global Technology Research, Samsung Electronics(三星电子全球技术研究)
AI总结 提出一种无训练图拉普拉斯能量优化方法ANoCo,通过查询补丁与正常流形对齐所需的更新幅度来度量异常,无需学习参数或采样,在标准基准上取得强图像级AUROC和稳定定位图。
Comments Accepted to CVPR 2026
DebFilter: 消除隐藏在值中的偏见
机构 * School of Integrated Technology, BK21 Graduate Program in Intelligent Semiconductor Technology(整合技术学院,智能半导体技术BK21研究生项目)
AI总结 提出DebFilter,一种轻量级、无需训练的方法,通过调整交叉注意力中的值分量来纠正文本到图像扩散模型中的社会偏见,实现推理时偏差缓解。
Comments 8 pages, 7 figures, supplementary material included, CVPR 2026
BlazeEdit: 基于图像到图像扩散模型的移动设备通用图像编辑
机构 * Google(谷歌)
AI总结 提出BlazeEdit,一个仅195M参数的轻量级通用图像编辑扩散模型,通过消除文本条件组件和多任务架构,在移动设备上实现快速、隐私保护的图像编辑。
Comments Accepted to CVPR 2026 EDGE Workshop
教师与求解器智能体之间的反思性对话用于视频问答
机构 * Nagoya Institute of Technology(名古屋技术大学)
AI总结 提出一种仅通过推理时上下文注入的适应方法,利用教师与求解器智能体之间的反思性对话(RD)来提升视频问答性能,在EgoCross基准上超越零样本和标准上下文学习,获得CVPR 2026 EgoVis Workshop跨域挑战赛开源赛道第三名。
Comments Yhis paper serves as the technical report for the 1st Cross-Domain EgoCross Challenge @ EgoVis Workshop, CVPR 2026
CuriosAI 在 EgoVis 2026 CASTLE 挑战赛中的提交
机构 * SoftBank Corp(软银公司)
AI总结 针对600多小时多视角自我中心视频的185道选择题,提出SVA(搜索-验证-回答)三阶段流水线和TMKG(时间多模态知识图谱)两种方法,SVA达到0.50准确率并作为最终提交。
Comments The 4th place solution for the CASTLE Challenge at the CVPR EgoVis Workshop 2026
有界计算多模态回归用于产品评分预测
机构 * Snap Inc.
AI总结 针对严格延迟预算下的标量回归任务,提出一种有界计算适配方法,通过替换语言模型头为轻量MLP并固定输入,在LoViF 2026挑战赛中实现高效多模态回归。
Comments Accepted to the LoViF Workshop at CVPR 2026. 8 pages, 2 figures
异步遥感时间序列融合用于云去除与任意时间重建
机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) ; School of Geographical Sciences and Urban Planning, Arizona State University(地理科学与城市规划学院,亚利桑那州立大学) ; Woodwell Climate Research Center(伍德沃德气候研究中心)
AI总结 提出AGFlow模型,通过时间对齐生成流匹配融合异步S1/S2数据,实现云去除、缺失帧重建及任意时间查询。
Comments CVPR 2026 MORSE Workshop
从情感到复杂行为:第十届ABAW研讨会与竞赛推进多模态以人为中心的人工智能
机构 * Queen Mary University of London(伦敦皇后玛丽大学) ; Hume AI ; Google Deepmind(谷歌DeepMind) ; Imperial College London(伦敦帝国理工学院) ; Cogitat ; LIVIA ; ILLS ; ETS Montreal(蒙特利尔ETS) ; Concordia University(Concordia大学) ; Xi’an Jiaotong University(西安交通大学)
AI总结 本文介绍了第十届ABAW研讨会与竞赛,通过多模态挑战和论文,推动真实环境下人类情感与行为的建模、分析和理解。
Comments accepted at CVPR 2026
LIFT and PLACE: 一种简单、稳定且有效的轻量级扩散模型知识蒸馏框架
机构 * Ulsan National Institute of Science and Technology (UNIST)(ulsan国家科学技术研究所)
AI总结 提出LIFT和PLACE框架,通过粗到细的蒸馏策略解决教师网络高复杂度带来的学生模仿困难,在极端压缩下仍能稳定训练并取得良好性能。
Comments Project page: https://hyun-s.github.io/LIFT_PLACE_site , 15 pages, 11 figure, 9 tables, To appear in CVPR 2026
EpiAgent: 一种以智能体为中心的古铭文修复系统
机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室(东南大学),教育部,中国) ; Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(计算机网络与信息集成关键实验室(东南大学),教育部,中国) ; Nanjing University Museum, Nanjing University, China(南京大学博物馆,南京大学,中国) ; The China Centre for Linguistic and Strategic Studies, Nanjing University, China(中国语言战略研究中心,南京大学,中国)
AI总结 提出基于智能体的EpiAgent系统,通过分层规划与LLM协调多模态分析、历史经验和专用工具,实现灵活自适应的古铭文修复,在真实退化铭文上取得更优修复质量和泛化能力。
Comments Accepted by CVPR 2026
ICR-Drive:面向端到端语言驱动自动驾驶的指令反事实鲁棒性
机构 * Texas Tech University(德克萨斯科技大学) ; Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))
AI总结 提出ICR-Drive框架,通过生成四类扰动指令(改写、歧义、噪声、误导)并基于CARLA仿真评估,揭示语言条件驾驶模型对指令变化的脆弱性。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 872-880
Next-Scale 自回归模型用于文本到运动生成
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出 MoScale 框架,通过从粗到细的时间分辨率分层生成运动,结合跨尺度和尺度内细化,实现高效、可扩展的文本到运动生成。
Comments Accepted to CVPR 2026
LESA: 可学习的阶段感知预测器用于扩散模型加速
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 针对扩散模型计算开销大、现有缓存策略难以适应去噪过程阶段动态变化的问题,提出基于两阶段训练的可学习阶段感知预测器框架,利用KAN网络学习时序特征映射并采用多阶段多专家架构,在保持高质量生成的同时实现显著加速。
Comments Accepted to CVPR 2026
SoC: 测试时提示调优的语义正交校准
机构 * MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学) ; LIVIA, ILLS, ÉTS Montréal(LIVIA,ILLs,蒙特利尔ÉTS)
AI总结 针对视觉语言模型测试时提示调优中校准被忽视的问题,提出基于Huber的正则化方法SoC,在保持语义邻近性的同时实现平滑的原型分离,从而改善校准性能并保持判别能力。
Journal ref CVPR 2026
FLAIR: 频率与位置感知的隐式神经表示
AI总结 针对隐式神经表示缺乏频率选择性和空间定位导致频谱偏差的问题,提出带限局部激活和小波能量引导编码,提升2D图像表示、3D形状重建和新视角合成性能。
Comments CVPR Findings 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/FLAIR/