Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment
持续模仿学习与多模态潜在回放及渐进调整
AI总结 本文提出了一种持续模仿学习方法,通过多模态潜在空间回放和渐进特征调整机制,在现实约束下实现持续策略优化,提升了在LIBERO基准上的性能。
Comments Accepted to CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
持续模仿学习与多模态潜在回放及渐进调整
AI总结 本文提出了一种持续模仿学习方法,通过多模态潜在空间回放和渐进特征调整机制,在现实约束下实现持续策略优化,提升了在LIBERO基准上的性能。
Comments Accepted to CVPR 2026
ReasonMap:迈向基于交通地图的细粒度视觉推理
AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。
Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/
稳定尖峰:通过位运算的双一致性优化用于脉冲神经网络
AI总结 本文提出通过位运算的双一致性优化方法,提升脉冲神经网络在超低延迟下的对象识别性能,准确率提升达8.33%。
Comments Accepted by CVPR 2026
PROMO: 可提示的高效高保真虚拟试衣
AI总结 PROMO通过流匹配DiT框架和潜在多模态条件拼接,实现高效高保真虚拟试衣,平衡保真度与效率。
Comments CVPR 2026
分词使多模态大语言模型能够理解、生成和编辑建筑平面图
机构 * Tsinghua University(清华大学) ; UC Berkeley(伯克利大学)
AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。
Comments 20 pages, 9 figures. Accepted to CVPR 2026
LaMoGen:通过LLM引导的符号推理实现语言到动作生成
机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)
AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。
Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/
EReCu: 多线索学习下的伪标签演化融合与精炼用于无监督伪装检测
AI总结 EReCu提出了一种统一的无监督伪装检测框架,通过多线索学习提升伪标签可靠性与特征保真度,结合原生感知模块、伪标签演化融合和局部精炼,实现高精度的伪装检测。
Comments Accepted by CVPR 2026
SPEGC:通过语义提示增强图聚类实现持续测试时间适应用于医学图像分割
AI总结 SPEGC通过语义提示增强图聚类方法,提升医学图像分割中持续测试时间适应的鲁棒性和性能。
Comments Accepted to CVPR 2026. 16 pages, 7 figures
Stay in your Lane: 角色特定查询与重叠抑制损失用于密集视频描述
机构 * Konkuk University(韩国康 kuk 大学) ; Sejong University(世宗大学) ; KAIST(韩国科学技术院)
AI总结 本文提出角色特定查询与重叠抑制损失,用于解决密集视频描述中的多任务干扰和时间冗余问题,通过分离定位与描述任务并增强语义一致性,提升描述精度。
Comments Accepted to CVPR 2026
GGPT:基于几何的点变换
机构 * ETH Zurich(苏黎世联邦理工学院) ; Delft University of Technology(代尔夫特理工大学)
AI总结 GGPT通过引入几何引导的点变换,结合密集前馈预测与显式几何约束,实现了更准确且一致的3D重建,提升了细粒度结构恢复和无纹理区域填补能力。
Comments CVPR 2026, Project website: https://chenyutongthu.github.io/research/ggpt
RC-NF:基于机器人条件的归一化流用于机器人操作中的实时异常检测
机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) ; Singapore Management University(新加坡国立大学)
AI总结 RC-NF通过实时监控机器人状态和物体运动轨迹,提升VLA系统在动态环境中的鲁棒性和适应性,实现异常检测与干预。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
StyleGallery: 无需训练且语义感知的任意图像参考个性化风格迁移
AI总结 StyleGallery通过语义感知和无需训练的框架,实现任意图像参考的个性化风格迁移,提升内容保留与风格化平衡能力。
Comments 18 pages, 23 figures, Conference on Computer Vision and Pattern Recognition 2026
双曲多视角预训练用于机器人操作
AI总结 本文提出HyperMVP,一种基于双曲空间的多视角自监督预训练框架,通过GeoLink编码器学习结构化嵌入,提升机器人操作任务的性能。
Comments This paper was submitted to CVPR 2026 and was recommended for Findings, but the authors have withdrawn it and are currently adding more content to submit it elsewhere
FastLightGen: 用更少的步骤和参数实现快速轻量视频生成
AI总结 FastLightGen通过同时压缩模型大小和推理步骤,实现快速轻量视频生成,实验表明其在受限预算下达到最优视觉质量并超越现有方法。
Comments Accepted by CVPR 2026
KnowVal: 一种知识增强且价值引导的自动驾驶系统
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) ; University of California, Merced(加州大学默塞德分校)
AI总结 KnowVal通过整合开放世界感知与知识检索,构建驾驶知识图谱并训练价值模型,实现价值对齐的自动驾驶系统,提升了规划性能并降低了碰撞率。
Comments Accepted to CVPR 2026
通过双阶段权重保护防御未经授权的模型合并
机构 * National Yang Ming Chiao Tung University ; Academia Sinica
AI总结 MergeGuard通过双阶段权重保护框架,有效防御未经授权的模型合并,减少合并模型准确性达90%,同时保持受保护模型性能损失低于1.5%。
Comments Accepted at CVPR 2026, updated
通过概率评估和校准提升基于外观的注视跟踪中不确定性估计的准确性
AI总结 本文提出了一种基于概率评估和校准的方法,用于提升基于外观的注视跟踪中不确定性估计的准确性,通过引入严格评价指标和修正策略来减少模型偏差并提高性能。
Comments 9 pages, 7 figures, 2 tables, to appear in CVPR 2026
SGI:结构化二维高斯用于高效且紧凑的大图像表示
机构 * University of Notre Dame(诺丁汉大学) ; Tohoku University(东洋大学) ; Leibniz-Institut für Analytische Wissenschaften – ISAS – e.V.(莱比锡分析科学研究所 – ISAS – e.V.)
AI总结 SGI通过结构化二维高斯方法实现高效且紧凑的大图像表示,实现高达7.5倍的压缩和1.6倍的优化速度,同时保持图像保真度。
Comments Accepted by CVPR 2026
CFG-Ctrl: 基于控制的分类器自由扩散引导
AI总结 CFG-Ctrl通过引入滑模控制方法改进分类器自由扩散引导,提升语义对齐和鲁棒性。
Comments Accepted by CVPR 2026; Project Page: https://hanyang-21.github.io/CFG-Ctrl
双层层位定位LoRA用于真实图像去雾
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; National Engineering Research Center of Digital Life(数字生活国家工程研究中心) ; Dalian University of Technology(大连理工大学) ; Xidian University(西安电子科技大学)
AI总结 本文提出双层层位定位LoRA方法,通过文本引导损失和自动层搜索提升真实图像去雾的适应性和效率。
Comments Accepted by CVPR 2026
通过语义退化条件引导扩散模型
机构 * College of Science, National University of Defense Technology(国防科技大学理学院)
AI总结 通过语义退化条件引导扩散模型,提升文本图像对齐与组合准确性。
Comments Accepted to CVPR 2026
WalkGPT: 基于深度感知的视觉语言对话用于行人导航
AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。
Comments Accepted by CVPR-2026
恢复以预测:渐进性回顾学习用于可变长度轨迹预测
机构 * Great Bay University(大湾大学) ; Tsinghua SIGS(清华大学SIGS) ; Wuhan University(武汉大学) ; NTU(国立科技大学) ; Donghua University(东华大学) ; CASIA(中国科学院自动化研究所)
AI总结 本文提出渐进回顾框架和滚动起始训练策略,用于解决可变长度轨迹预测中的信息缺口问题,提升预测准确性。
Comments Paper is accepted by CVPR 2026
属性作为检索:模型无关的AI生成图像属性
AI总结 本文提出了一种模型无关的AI生成图像归因方法LIDA,通过实例检索问题解决深度伪造检测和图像归因的挑战。
Comments To appear in CVPR 2026, Code is at https://github.com/hongsong-wang/LIDA
DSFlash:实时生成全景场景图
机构 * University of Augsburg(奥格斯堡大学)
AI总结 DSFlash是一种低延迟、资源高效的实时全景场景图生成模型,能够以高帧率处理视频流并提供更丰富的上下文信息。
Comments Accepted at CVPR 2026
通过超网络实现的稀疏任务向量混合用于全滑片图像预后中的高效知识转移
AI总结 STEPH通过超网络实现稀疏任务向量混合,提升全滑片图像预后中的知识转移效率
Comments Accepted to CVPR 2026
用反事实对抗幻觉:基于扩散引导的扰动用于LVLM幻觉抑制
机构 * York University(约克大学) ; Macquarie University(麦考瑞大学) ; Northern Illinois University(北伊利诺伊大学)
AI总结 CIPHER通过反事实图像扰动减少LVLM中的视觉幻觉,提升模型忠实性。
Comments CVPR 2026
极端非独立同分布与全局类别不平衡下的联邦主动学习
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
AI总结 FairFAL通过自适应类别公平机制,在极端非IID和全局类别不平衡环境下提升联邦主动学习性能。
Comments Accepted to CVPR 2026
Ego:基于嵌入的视觉-语言模型个性化
机构 * Toyota Motor Europe(丰田欧洲公司)
AI总结 本文提出了一种基于模型内部机制的高效视觉-语言模型个性化方法,通过提取目标概念的视觉标记实现个性化描述与记忆。
Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
相似性作为证据:校准过度自信的视觉语言模型以实现可解释且标注高效的医学主动学习
机构 * School of Electronic Technology and Engineering, Xiamen University, Xiamen, China(厦门大学电子技术与工程学院,厦门,中国) ; School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院,厦门,中国) ; School of Engineering, Case Western Reserve University, Cleveland, USA(凯斯西储大学工程学院,克利夫兰,美国)
AI总结 SaE框架通过引入相似性证据头校准视觉语言模型,以提高医学主动学习的可解释性和标注效率。
Comments Accepted to CVPR 2026 (to appear)