Language-Free Generative Editing from One Visual Example
无需语言的生成编辑:一个视觉示例
AI总结 本文提出无需语言指导的视觉编辑方法VDC,通过直接从视觉示例学习条件信号,实现高精度图像编辑,优于现有无训练和全微调方法。
Comments Accepted at CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
无需语言的生成编辑:一个视觉示例
AI总结 本文提出无需语言指导的视觉编辑方法VDC,通过直接从视觉示例学习条件信号,实现高精度图像编辑,优于现有无训练和全微调方法。
Comments Accepted at CVPR 2026
HiSpatial:在视觉-语言模型中驯服层次化3D空间理解
机构 * Tsinghua University(清华大学) ; Microsoft Research Asia(微软亚洲研究院) ; Xi’an Jiaotong University(西安交通大学) ; University of the Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出一种层次化框架,通过分解VLM中3D空间理解的学习过程,从几何感知到抽象空间推理,生成多样化任务和场景的3D空间VQA对,提升视觉-语言模型的空间理解能力。
Comments Accepted by CVPR 2026. Project page: https://microsoft.github.io/HiSpatial
PMT:用于图像和视频分割的Plain Mask Transformer,使用冻结的视觉编码器
机构 * Eindhoven University of Technology(埃因霍温理工大学)
AI总结 PMT通过冻结视觉基础模型的编码器,提出Plain Mask Decoder,实现高效分割任务,兼具速度和准确性,适用于图像和视频分割。
Comments 8 pages, ECV 2026, CVPR Workshop
HeSS:用于VGGT中稀疏性再分配的头部敏感度评分
AI总结 本文提出HeSS方法,通过量化头部稀疏性敏感度来优化VGGT的稀疏性再分配,提升模型在高稀疏度下的鲁棒性。
Comments Accepted to CVPR 2026
基于图神经网络的自适应学习图像压缩
机构 * Shanghai Jiao Tong University(上海交通大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Alibaba Group(阿里巴巴集团) ; Shanghai AI Laboratory(上海人工智能实验室)
AI总结 本文提出基于图神经网络的自适应学习图像压缩框架,通过构建双尺度图结构和动态连接性,实现灵活的数据驱动感受野,从而更高效地建模图像中的多样性冗余,提升压缩性能。
Comments Accepted by CVPR 2026
激活至关重要:基于视觉语言模型的测试时激活负标签用于分布外检测
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Stanford University(斯坦福大学)
AI总结 本文提出测试时激活负标签(TANL)方法,通过动态评估激活水平和测试批次内的激活信息,提升分布外检测的性能和鲁棒性,实验表明其在ImageNet基准上显著降低FPR95。
Comments CVPR 2026 main track, Codes are available at https://github.com/YBZh/OpenOOD-VLM
通过层适应性O.O.D校正实现免费午餐长视频生成
机构 * Westlake University(西湖大学)
AI总结 本文提出FreeLOC框架,通过层适应性机制解决长视频生成中的O.O.D问题,提升时序一致性和视觉质量。
Comments Accepted to CVPR 2026. Code: https://github.com/Westlake-AGI-Lab/FreeLOC
基于概率概念图推理的多模态虚假信息检测
机构 * University of Science and Technology Beijing(北京科技大学) ; Singapore Management University(新加坡管理大学) ; Hong Kong Baptist University(香港浸会大学)
AI总结 本文提出PCGR框架,通过构建概念图进行多模态虚假信息检测,实现可解释且可进化的方法,提升检测准确性和抗新兴操纵能力。
Comments Accepted by CVPR 2026
TacSIm: 一场足球战术风格仿真的数据集和基准
AI总结 TacSIm通过模拟英超比赛中的球员动作,提供了一种评估足球战术风格仿真的新方法,利用空间占用相似性和运动向量相似性进行量化评估。
Comments Accepted to CVPR 2026
一种用于多类3D异常检测的语义解耦统一模型
机构 * Kyung Hee University(庆熙大学)
AI总结 本文提出一种语义解耦的统一模型,通过解耦语义表示提升多类3D异常检测的可靠性与性能,实验表明其在统一模型和类别特定模型上均取得SOTA结果。
Comments Accepted by CVPR 2026
EgoXtreme:用于极端条件下眼动视角物体姿态估计的数据集
机构 * Seoul National University(首尔大学) ; VGG, University of Oxford(牛津大学VGG实验室)
AI总结 本文提出EgoXtreme数据集,用于评估在极端条件下眼动视角下物体姿态估计的鲁棒性,发现现有方法在极端条件下表现不佳,需进一步改进。
Comments Camera ready version for CVPR 2026, appendix included
AnyDoc:通过大规模HTML/CSS数据合成和高度感知强化优化提升文档生成
机构 * Xi’an Jiaotong University(西安交通大学) ; Adobe Research(Adobe研究院)
AI总结 AnyDoc通过大规模HTML/CSS数据合成和高度感知强化优化,实现多文档生成任务,包含265206个样本,覆盖111类和32种风格,提升文档生成性能。
Comments CVPR 2026 Main Conference
MSRL: 通过多阶段强化学习扩展生成多模态奖励建模
机构 * Northeastern University, Shenyang, China(东北大学(沈阳)) ; ByteDance(字节跳动)
AI总结 本文提出MSRL方法,通过多阶段强化学习在有限多模态数据下扩展生成多模态奖励模型,提升视觉理解和生成任务性能,无需额外标注数据。
Comments Accepted by CVPR 2026
RS-SSM:通过状态空间模型细化遗忘的特定信息以实现视频语义分割
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) ; Tsinghua University(清华大学) ; Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出RS-SSM模型,通过互补细化遗忘的时空细节,提升视频语义分割的像素级处理能力,在四个基准上取得最佳性能。
Comments Accepted by CVPR 2026
符合性跨模态主动学习
机构 * AIT Austrian Institute of Technology(奥地利理工学院) ; Automation & Control Institute, Technical University of Vienna(维也纳技术大学自动化与控制研究所) ; Chair of Information Theory and Data Analytics (INDA), RWTH Aachen University(亚琛工业大学信息理论与数据分析教席)
AI总结 本文提出CCMA框架,通过教师-学生架构融合视觉与语言模态,利用多模态符合评分与多样性意识选择策略,提升数据效率。
Comments 20 pages, 14 figures
Journal ref CVPR 2026 Findings
组级编辑:一次操作编辑多张图像
机构 * HKUST(香港科技大学) ; THU(清华大学) ; SJTU(上海交通大学) ; University of Technology Sydney(悉尼科技大学)
AI总结 本文提出组级编辑框架,通过显式和隐式关系建立实现多图像一致修改,引入融合机制和新数据集提升编辑质量与一致性。
Comments Accepted by CVPR 2026, Project page: https://group-editing.github.io/, Github: https://github.com/mayuelala/GroupEditing
跨实例高斯点云对齐 via 几何感知特征引导对齐
机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)
AI总结 本文提出GSA方法,通过相似变换对齐不同类别的3DGS模型,无需真实尺度输入,通过迭代特征引导绝对对齐和多视图特征一致性优化,实现跨实例对齐。
Comments Accepted to CVPR 2026
Cov2Pose:利用空间协方差实现直接的流形感知6自由度物体姿态估计
机构 * Université de Lorraine, CNRS, Inria, LORIA(洛林大学,法国国家科学研究中心,法国国家信息与自动化研究所,洛林计算机科学及其应用实验室) ; Infinite Orbits(Infinite Orbits公司) ; Cristal Laboratory, ENSI, University of Manouba(马努巴大学国家计算机科学学院Cristal实验室)
AI总结 本文提出Cov2Pose,通过空间协方差池化实现直接姿态估计,利用SPD矩阵的流形感知网络头提升姿态回归的鲁棒性和准确性。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
具有自约束先验的3D高斯点云用于高保真的表面重建
机构 * School of Software, Tsinghua University(清华大学软件学院) ; Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)
AI总结 本文提出自约束先验以约束3D高斯学习,提升深度渲染精度,通过融合当前3D高斯生成的深度图得到TSDF网格,生成带状约束以优化高斯分布,同时定期更新以提高准确性。
Comments Accepted by CVPR 2026. Project page: https://takeshie.github.io/GSPrior
Mario:基于大语言模型的多模态图推理
机构 * New York University Shanghai(上海纽约大学) ; New York University(纽约大学) ; Tsinghua University(清华大学) ; EPFL(瑞士联邦理工学院洛桑)
AI总结 Mario通过多模态图推理框架解决跨模态一致性与异构模态偏好问题,实现对多模态图的有效推理,优于现有图模型。
Comments CVPR 2026
CoIn3D:重新审视配置不变的多摄像头3D目标检测
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) ; Intelligent Transportation Thrust of the Systems Hub, HKUST(GZ)(香港科技大学(广州)系统枢纽智能交通学域) ; Amazon Alexa AI(亚马逊Alexa人工智能)
AI总结 本文提出CoIn3D框架,通过空间先验整合和摄像头感知数据增强,提升多摄像头3D目标检测在不同配置下的泛化能力。
Comments Accepted to CVPR 2026 main track
GeodesicNVS: 基于概率密度几何流的新型视角合成
机构 * Huawei Hilbert Research Center (Dresden)(华为希尔伯特研究中心(德累斯顿)) ; Technical University of Munich(慕尼黑工业大学) ; Karlsruhe University of Applied Sciences(卡尔斯鲁厄应用科学大学)
AI总结 本文提出PDG-FM方法,通过数据依赖的几何正则化提升确定性流匹配的视角一致性,实验证明在Objaverse和GSO30数据集上优于扩散模型。
Comments Accepted by CVPR 2026; Project Page see https://xuqinwang.github.io/geodesicNVS.github.io/
从尺度到速度:面向图像编辑的自适应测试时间缩放
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) ; AMAP, Alibaba Group(阿里巴巴集团高德地图) ; University of Queensland(昆士兰大学)
AI总结 本文提出ADE-CoT框架,通过动态资源分配、编辑特定验证和深度优先停止策略,提升图像编辑效率与性能,实验显示在同等采样预算下性能优于现有方法。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
MeanFuser: 一种基于MeanFlow的高效多模态轨迹生成与自适应重构方法用于端到端自动驾驶
机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Xiaomi EV(小米汽车) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院)
AI总结 本文提出MeanFuser,通过引入Gaussian Mixture Noise、MeanFlow Identity和轻量级ARM模块,实现了高效且鲁棒的多模态轨迹生成与自适应重构,提升了端到端自动驾驶的性能和效率。
Comments Accepted by CVPR 2026
统一的原始代理用于结构形状补全
机构 * Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
AI总结 本文提出UniCo,通过统一路径解码几何、语义和内点成员,提升结构形状补全效果,降低Chamfer距离达50%。
Comments CVPR 2026
3D无需3D扫描:从视频生成点云进行可扩展预训练
机构 * AIST(产业技术综合研究所) ; University of Technology Nuremberg(纽伦堡工业大学) ; University of Oxford(牛津大学) ; INRIA(法国国家信息与自动化研究所)
AI总结 本文提出LAM3C框架,通过视频生成点云进行自监督学习,无需真实3D扫描即可在室内语义和实例分割中取得更好性能。
Comments Accepted to CVPR 2026. Project page: https://ryosuke-yamada.github.io/lam3c/
Widget2Code: 通过多模态大语言模型从视觉小部件到UI代码
机构 * McMaster University(麦克马斯特大学) ; University of Toronto(多伦多大学) ; University of Waterloo(滑铁卢大学) ; Concordia University(康考迪亚大学)
AI总结 本文提出Widget2Code任务,通过多模态大语言模型提升小部件到UI代码的生成能力,设计了图像-only基准测试和WidgetFactory框架,提升视觉保真度。
Comments CVPR 2026, Code: https://github.com/Djanghao/widget2code
TimeLens:重新思考视频时间接地与多模态大语言模型
机构 * Nanjing University(南京大学) ; ARC Lab, Tencent PCG(腾讯PCG ARC实验室) ; Shanghai AI Lab(上海人工智能实验室)
AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。
Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/
MoRel:通过基于锚点中继的双向混合与分层密集化实现长距离无闪烁的4D运动建模
AI总结 本文提出MoRel框架,通过锚点中继双向混合与分层密集化方法,实现长距离动态场景的高效4D重建,解决内存占用、时间闪烁及遮挡处理问题。
Comments CVPR 2026 (camera ready ver.). The first two authors contributed equally to this work (equal contribution). Please visit our project page at https://cmlab-korea.github.io/MoRel/
通过视觉符号诊断、纠正并学习操纵失败
机构 * Beihang University(北京航空航天大学) ; Shanghai Innovation Institute(上海创新研究院) ; Southern University of Science and Technology(南方科技大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出ViFailback框架,通过视觉符号提升标注效率,并释放大规模数据集和基准测试,验证了框架在故障诊断和纠正中的有效性。
Comments Accepted by CVPR 2026. Project Website: https://x1nyuzhou.github.io/vifailback.github.io/