Global Structure-from-Motion Meets Feedforward Reconstruction
全局运动恢复结构与前馈重建的结合
机构 * ETH Zurich(苏黎世联邦理工学院) ; Meta Reality Labs(Meta现实实验室) ; Microsoft(微软公司)
AI总结 提出一种结合经典SfM和前馈重建优势的新流水线,在多种场景下实现最先进的重建结果。
Comments CVPR 2026, Highlight
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
全局运动恢复结构与前馈重建的结合
机构 * ETH Zurich(苏黎世联邦理工学院) ; Meta Reality Labs(Meta现实实验室) ; Microsoft(微软公司)
AI总结 提出一种结合经典SfM和前馈重建优势的新流水线,在多种场景下实现最先进的重建结果。
Comments CVPR 2026, Highlight
从对比到一致性:重新思考基于事件的连续时光流估计
机构 * Xidian University(西安电子科技大学)
AI总结 提出一种基于时空结构一致性(STSC)的混合监督框架,结合双向互补多尺度架构和课程引导混合训练策略,在连续时间和标准光流估计中达到最先进性能。
Comments Accepted by CVPR 2026
SRL-CLIP: 通过结构化语义角色标签实现高效的CLIP视频适配
机构 * CVIT, IIIT Hyderabad(IIIT海得拉巴计算机视觉研究所) ; Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所、巴黎综合理工学院、国家科学研究中心、巴黎高等研究大学)
AI总结 本文提出SRL-CLIP,利用结构化语义角色标签(SRL)生成规则化字幕,仅用23k视频-字幕对进行对比微调,即可高效适配CLIP用于通用视频理解,在零样本文本-视频检索上性能优于参数多4-8倍、数据多6000倍的模型。
Comments Accepted to the CV4Smalls Workshop at CVPR 2026
DirectFisheye-GS: 在三维高斯泼溅中通过跨视图联合优化实现原生鱼眼输入
机构 * BNRist, Tsinghua University(北京理工大学,清华大学) ; Beihang University(北航) ; JD.com, Beijing, China(京东(北京,中国)) ; Shanghai AI Lab(上海人工智能实验室)
AI总结 针对鱼眼相机输入导致的信息丢失和细节模糊问题,提出将鱼眼相机模型集成到3DGS框架中,并引入基于特征重叠的跨视图联合优化策略,实现无需预处理的原生鱼眼图像训练,提升重建质量。
Comments CVPR 2026 Highlight; Fix NSFC ID
GS-CLIP: 基于几何感知提示与协同视图表示学习的零样本3D异常检测
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 提出GS-CLIP框架,通过几何感知提示和协同视图表示学习,在零样本设置下有效检测3D点云中的几何异常。
Comments Accepted by CVPR 2026
LuxRemix: 室内场景的光照分解与重新混合
机构 * Meta Reality Labs(Meta现实实验室) ; University of Toronto(多伦多大学)
AI总结 提出一种基于图像的光照分解模型,从多视图场景捕获中分解室内光照为独立光源,并通过多视图光照协调集成到可重光照的3D高斯溅射表示中,实现交互式光源编辑。
Comments CVPR 2026. Project page: https://luxremix.github.io
结构化关系推理用于群体活动评估
机构 * University of Stuttgart(斯图加特大学) ; University of Hildesheim(希尔德斯海姆大学)
AI总结 提出ProGraD框架,利用冻结视觉基础模型和轻量级GroupContext Transformer,通过结构化关系推理在单次前向传播中联合推断群体位置、成员关系和活动,仅用10M参数即在Cafe和Social-CAD基准上取得最优性能。
Comments Accepted to CVPR 2026 Workshop (SAUAFG)
高效的全对相关性体素采样用于光流估计
机构 * DisneyResearch|Studios(迪士尼研究与工作室) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 提出一种内存和计算高效的算法,实现全对相关性体素采样的精确数学运算,在保持低内存占用的同时显著提升速度,并应用于高分辨率光流估计达到最优性能。
Comments CVPR 2026
V2V3D:用于光场显微镜的视图到视图去噪三维重建
机构 * Tsinghua University, Beijing 100084, China(清华大学,北京100084,中国) ; Shanghai AI Laboratory, China(上海人工智能实验室,中国)
AI总结 提出无监督视图到视图框架V2V3D,联合优化图像去噪和三维重建,利用噪声独立性实现噪声到噪声去噪,并设计基于波动光学的特征对齐技术恢复高频细节,在效率和性能上超越现有方法。
Comments CVPR 2025; New version: Fix NSFC ID
ImViD:用于增强VR沉浸感的沉浸式体积视频
机构 * Tsinghua University(清华大学) ; Migu Beijing Research Institute(中国移动北京研究院) ; Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所)
AI总结 提出ImViD多视角多模态数据集,支持移动中捕获完整场景,为6自由度多模态沉浸式VR体验提供基准和重建管线。
Comments CVPR 2025 Highlight; Fix NSFC ID
应对源自由跨域小样本学习中加剧的注意力汇聚问题
机构 * Huazhong University of Science and Technology(华中科技大学)
AI总结 针对跨域小样本学习中标准微调加剧注意力汇聚导致判别性下降的问题,提出基于令牌动态重加权的方法抑制简单令牌依赖并增强困难令牌学习,实现新最优性能。
Comments Accepted by CVPR 2026
OMGTex: 无需几何引导的一阶段多风格面部纹理重建
机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) ; Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能化重点实验室) ; FNii-Shenzhen(FNii-深圳)
AI总结 提出OMGTex,一种端到端的扩散框架,无需3D几何先验,直接从多风格面部图像重建高质量、可编辑的UV纹理,通过梯度引导推理和语义感知训练实现鲁棒重建与编辑。
Comments CVPR 2026 (Poster)
ComPose:用于鲁棒类别级物体姿态估计的统一补全-姿态框架
机构 * University of Science and Technology of China(中国科学技术大学) ; National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家空间科学探测重点实验室,深空探测实验室) ; Beijing Institute of Control Engineering(北京控制工程研究所)
AI总结 提出ComPose框架,通过关键点渐进补全模块和几何关系一致性损失,将形状补全与姿态估计紧密集成,在不依赖类别级形状先验的情况下提升点云不完整场景下的姿态估计精度和效率。
Comments Accepted by CVPR 2026 (Oral, Best Paper Award Candidate). Project page is available at renhuan1999.github.io/ComPose
MTLLFM: 多模态时间笑声定位——UR-FUNNY-Temporal和SMILE-Temporal基准数据集与自适应多模态融合模型
机构 * WSC-Sports(WSC-体育)
AI总结 针对现有方法无法精确捕捉短暂笑声事件时间边界的问题,本文提出两个完全标注的时间笑声数据集(UR-FUNNY-Temporal和SMILE-Temporal)和一个轻量级弱监督框架,通过固定HuBERT和MAE编码器结合时间softmax池化与自适应模态门控,实现从片段级标签到帧级时间定位,在体育广播数据上达到99% F1和68.1%定位精度,并将下游笑声推理CIDEr提升227%。
Comments Accepted to the Workshop on Affective & Behavior Analysis in-the-wild, CVPR 2026
当可解释性成为负担:针对CBM概念层的对抗攻击
机构 * Independent Researcher(独立研究者)
AI总结 本文系统研究了概念瓶颈模型(CBM)中概念层的对抗性脆弱性,提出了一种基于语义扰动的稳定性正则化防御方法SPECTRA,显著提高了攻击所需的最小扰动范数,同时保持了分类精度。
Comments Accepted to CVPR 2026 (Findings). 9 pages, 6 figures
CounterFlow: 一种用于反事实视频拟音生成的两阶段推理时采样方法
机构 * Kim Jaechul Graduate School of AI, KAIST(金 Jaechul人工智能研究生院,韩国科学技术院)
AI总结 提出CounterFlow,一种两阶段推理时采样方案,用于预训练的流匹配VT2A模型,以生成与视觉证据矛盾但时间同步的反事实视频拟音,并通过新指标评估替换质量。
Comments accepted to CVPR 2026 Workshop on Sight and Sound
EgoMind: 通过多模态大语言模型中的语言推理激活空间认知
机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) ; School of Computer Science and Engineering(计算机科学与工程学院)
AI总结 提出EgoMind框架,通过角色扮演描述和渐进空间分析的无几何空间推理方法,仅用少量数据即可在多基准测试中提升MLLMs的空间推理能力。
Comments Accepted by CVPR 2026
面向自动驾驶的空间感知视觉语言模型
机构 * Motional ; University of Amsterdam(阿姆斯特丹大学)
AI总结 提出LVLDrive框架,通过融合LiDAR点云与视觉语言模型,利用渐进融合Q-Former和空间感知问答数据集,解决3D度量空间推理瓶颈,提升自动驾驶场景理解与决策可靠性。
Comments Accepted to CVPR AutoPilot Workshop 2026
DASH:一种用于合成有效且隐蔽的对抗样本的元攻击框架
机构 * University of Maine(缅因大学) ; University of Florida(佛罗里达大学) ; University of Tennessee, Knoxville(田纳西大学,基洛纳)
AI总结 提出DASH元攻击框架,通过多阶段自适应组合Lp约束攻击方法,生成有效且感知对齐的对抗样本,在多个数据集上优于现有方法。
Comments Accepted to CVPR 2026
残差连接损害生成式表示学习
机构 * University of Chicago(芝加哥大学) ; Fudan University(复旦大学) ; Tencent(腾讯) ; Shanghai Academy of AI for Science(上海人工智能科学研究院)
AI总结 通过减少残差网络中恒等捷径的权重,显著提升掩码自编码器和扩散模型等生成式表示学习框架中的语义特征学习质量。
Comments accepted to CVPR 2026
你可以比看见更早定位:一种用于压缩视频中时序句子定位的高效流程
机构 * The Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(大数据安全湖北工程研究中心,网络安全科学与工程学院,华中科技大学) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
AI总结 提出一种三分支压缩域时空融合框架(TCSF),直接从压缩视频中提取I帧、运动向量和残差特征,实现高效准确的时序句子定位。
Comments Accepted by CVPR 2023
无需多视图生成的多视图一致3D高斯头部头像
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出MVCHead,一种直接从随机采样的2D图像学习3D高斯头部模型的方法,通过层次状态空间块和SE(3)多视图评判器实现多视图一致性,无需多视图数据或3D监督。
Comments CVPR 2026; Project Website: https://humansensinglab.github.io/MVCHead/
Journal ref CVPR, Denver, CO, USA, 2026, pp. 40163-40174
PQDT: 伪查询双Transformer用于鲁棒点云修复
机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ; University of Bonn(波恩大学) ; Fraunhofer SCAI(弗劳恩霍夫SCAI研究所)
AI总结 提出一种基于伪查询模块和Transformer主干网络的统一3D修复网络,通过两阶段几何变换增强结构清晰度和局部细节,在多种退化场景下超越现有方法。
Comments To be published in The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
从语义字典中学习:面向统一视觉表示与生成的判别式码本对比学习
机构 * Universitat de Barcelona(巴塞罗那大学) ; Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心)
AI总结 提出LEASE框架,通过配对生成-判别码本设计,在离散标记空间中联合优化掩码重建损失和码本对比损失,实现统一视觉表示与生成,在ImageNet-1K上达到最先进性能。
Comments Accepted at CVPR'26
Tempered Self-Similarity Alignment for Physically Plausible Video Generation
机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)
AI总结 提出Tempered Self-Similarity Alignment (TSA)损失函数,通过将视觉基础模型中的时空自相似性关系知识迁移到视频生成模型中,以改善视频的物理合理性。
Comments Accepted to the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE)
三步条件扩散光场显微三维重建
机构 * Yanshan University(雁山大学) ; Peking University(北京大学)
AI总结 针对光场显微成像中传统算法分辨率低、伪影重、计算成本高,以及现有学习方法重建精度和泛化能力不足的问题,提出一种基于三步条件扩散的高保真三维重建方法,通过确定性三步采样和轻量条件U-Net实现快速准确重建,并引入类间检测模块增强稳定性。
Comments 10 pages, 6 figures. Accepted to CVPR 2026 Findings
BED-SAM2: 通过单目几何先验增强边界的深度SAM2
机构 * University of Delaware(德克萨斯大学) ; University of South Florida(佛罗里达州立大学) ; DEVCOM Army Research Laboratory(国防部陆军研究实验室)
AI总结 本研究通过修改SAM2编码器以直接编码单目深度信息,提出BED-SAM2模型,在少量训练周期内实现显著和伪装物体检测的竞争性能。
Comments 9 pages, 5 figures, 5 tables. Presented as a poster at the CVPR 2026 Workshop on Computer Vision in the Wild (CVinW). Code available at https://github.com/TylerRust-1/BED-SAM2
HCL-FF:用于前向-前向算法的分层对比学习
机构 * University of Southern California(南加州大学)
AI总结 针对前向-前向算法缺乏分层协调和特征语义模糊的问题,提出HCL-FF框架,通过粗到细的分层学习策略和监督对比学习目标,在CIFAR-10等数据集上取得FF方法最佳性能。
Comments Accepted by CVPR 2026. Code: https://github.com/JNNNNYao/HCL-FF
4KLSDB:用于4K图像恢复与生成的大规模数据集
机构 * Texas A&M University(德克萨斯A&M大学) ; Hugging Face
AI总结 为解决现有数据集缺乏原生4K分辨率和规模的问题,提出包含129,484张4K图像的大规模数据集4KLSDB,并通过多阶段自动过滤和标注确保质量,实验证明其在超分辨率和扩散模型训练中能显著提升4K基准性能。
Comments Accepted to the DataCV Workshop at CVPR 2026; 10 pages, 4 figures, 7 tables; Our project page is available at: https://4klsdb.github.io/
点云中的鬼影:瞬态域中的LiDAR去眩光
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 针对固态LiDAR内部多径眩光导致的伪影问题,提出基于瞬态眩光扩散函数(TGSF)的物理模型和无训练算法,在点云形成前抑制眩光,保留真实场景结构。
Comments CVPR 2026