PhyGaP: Physically-Grounded Gaussians with Polarization Cues
PhyGaP:基于极化线索的物理 grounded 高斯分布
AI总结 PhyGaP利用极化线索改进3D高斯分布,通过极化延迟渲染和网格映射技术实现高精度反射分解和逼真光照重映射,实验表明其在反射3D物体重建和逆渲染方面表现优异。
Comments The paper is accepted by CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
PhyGaP:基于极化线索的物理 grounded 高斯分布
AI总结 PhyGaP利用极化线索改进3D高斯分布,通过极化延迟渲染和网格映射技术实现高精度反射分解和逼真光照重映射,实验表明其在反射3D物体重建和逆渲染方面表现优异。
Comments The paper is accepted by CVPR 2026
Shape-of-You: 基于融合Gromov-Wasserstein最优传输的语义对应研究
AI总结 本文提出Shape-of-You框架,通过融合Gromov-Wasserstein优化传输解决语义对应问题,利用3D基础模型提升几何结构一致性,通过软目标损失增强鲁棒性,在SPair-71k和AP-10k数据集上取得新突破。
Comments Accepted at CVPR 2026. Supplementary material included after references. 18 pages, 11 figures, 10 tables
基于概念引导的微调:引导ViT远离虚假相关性以提高鲁棒性
AI总结 本文提出一种引导模型推理至概念层面语义的微调框架,通过优化内部相关性映射对齐空间 grounded 的概念掩码,提升模型在分布偏移下的鲁棒性。
Comments CVPR 2026 ; Project page: https://yonisgit.github.io/concept-ft/
DC-Merge:通过方向一致性提升模型合并
AI总结 本文提出DC-Merge方法,通过平衡任务向量能量分布和对齐方向几何,解决模型合并中的方向一致性问题,实验表明在视觉和视觉-语言基准上均取得最优性能。
Comments Accepted by CVPR 2026 Main Track
ProFocus:面向视觉-语言导航的前瞻性感知与聚焦推理
AI总结 ProFocus通过大语言模型与视觉-语言模型的协作,实现前瞻性感知和聚焦推理,提升视觉-语言导航任务的效率与准确性。
Comments Accepted by CVPR 2026
MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿
AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。
Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA
CHIPS: 通过曲率感知的混合影响数据选择实现高效的CLIP适应
AI总结 本文提出CHIPS方法,通过曲率感知和混合影响数据选择,实现高效的CLIP垂直领域适应,在医疗和通用领域基准中均表现出色。
Comments Accepted by CVPR 2026
状态混合:用于多模态生成的路由令牌级动态
AI总结 本文提出MoS,一种多模态扩散模型的融合范式,通过灵活的状态交互融合模态。核心是可学习的令牌路由器,通过时间步和输入依赖的交互对模态隐藏状态进行去噪,实现令牌级特征与扩散轨迹的精确对齐。
Comments Accepted to CVPR 2026; Homepage: https://haozheliu-st.github.io/mos-homepage/
OneOcc: 为四足机器人和人形机器人提供基于单个全景相机的语义占用预测
AI总结 OneOcc通过双投影融合、双格体素化、轻量解码器和步态位移补偿模块,实现四足机器人和人形机器人的语义占用预测,解决了步态引起的身体抖动和360度连续性问题。
Comments Accepted to CVPR 2026. Datasets and code will be publicly available at https://github.com/MasterHow/OneOcc
StreamingTOM: 流式令牌压缩以实现高效的视频理解
AI总结 StreamingTOM通过双阶段框架解决流式视频视觉-语言模型中预-后LLM瓶颈,实现kv-cache压缩和低延迟,提升实时视频理解效率。
Comments Accepted at CVPR 2026. Project page: https://yige24.github.io/StreamingTOM
UniMMAD: 一种基于MoE驱动特征解压的多模态多类别异常检测统一框架
AI总结 UniMMAD通过MoE驱动的特征解压机制,实现多模态和多类别异常检测的统一,解决传统方法在领域变化和内存占用上的不足,提升检测效率与准确性。
Comments Accepted by CVPR 2026
面向最少微调数据的高效医疗推理
AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。
Comments Accepted by CVPR 2026
SegQuant: 一种语义感知且通用的扩散模型量化框架
AI总结 SegQuant提出一种统一的量化框架,通过自适应结合互补技术提升跨模型通用性,采用结构感知图量化策略和双尺度量化方案,有效保持视觉保真度,适用于Transformer扩散模型及其他模型。
Comments 22 pages, 15 figures, to be published in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026), code is available at https://github.com/OptiSys-ZJU/segquant
迈向无约束第一人称视频中稳定的自监督物体表示
AI总结 本文提出EgoViT框架,通过三种协同机制学习稳定物体表示,提升无监督物体发现和语义分割性能。
Comments 24 pages, 11 figures. Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
步级推理:面向医学视觉问答的逐步视觉推理
AI总结 本文提出Step-CoT,通过结构化多步推理提升医学视觉问答的准确性和可解释性,引入专家 curated 的医疗诊断流程对齐的推理数据集和动态图结构聚焦机制。
Comments Accepted by CVPR 2026 Finding Track
通过服务器梯度冲突缓解和表达实现高效的联邦反学习
AI总结 本文提出FOUL框架,通过学习-反学习阶段和服务器知识聚合阶段,解决联邦反学习中的跨客户端知识不可达和高计算通信成本问题,提出时间到遗忘指标,实验证明其在效率和隐私保护上的优势。
Comments 21 pages, 11 figures, 4 tables, CVPR 2026
Ego-1K -- 一个大规模多视角视频数据集用于第一人称视觉
AI总结 Ego-1K数据集通过12个同步相机采集近1000个短视频,用于推动神经3D视频合成和动态场景理解,其核心挑战在于近距离动态物体和设备自身运动导致的大视差和图像运动。
Comments To appear in CVPR 2026
每种错误都有其严重性:面向多类多实例学习的不对称错误严重性训练
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Seegene Medical Foundation(Seegene医疗基金会)
AI总结 本文提出一种考虑错误严重性的训练策略,通过层次结构优化和概率对齐提升多类多实例学习的诊断准确性,减少临床关键错误。
Comments Accepted by CVPR 2026
从掩码引导自监督学习中学习通用的3D医学图像表示
机构 * Stanford University(斯坦福大学)
AI总结 本文提出MASS方法,通过掩码引导自监督学习,学习通用的医学图像表示,实现了在不同数据集上的高效分割和分类任务。
Comments CVPR 2026
COT-FM:分簇最优传输流匹配
机构 * National Taiwan University(台湾大学)
AI总结 COT-FM通过分簇策略优化流匹配框架,提升生成速度与可靠性,适用于图像生成和机器人任务。
Comments 18pages, CVPR 2026 accepted
GraphVLM:多模态图学习的视觉语言模型基准测试
机构 * NYU Shanghai(纽约大学上海分校) ; New York University(纽约大学) ; Rice University(休斯顿大学) ; East China Normal University(华东师范大学)
AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。
Comments CVPR 2026
注意源无关跨域少样本学习中的判别性陷阱
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) ; National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)
AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。
Comments CVPR 2026
通过概念提示绑定从图像和视频中组合概念
机构 * HKUST(香港科技大学) ; CUHK(香港大学) ; HKUST(GZ)(香港科技大学(广州))
AI总结 本文提出Bind & Compose方法,通过绑定视觉概念与提示标记实现灵活的视觉概念组合,提升概念一致性和运动质量。
Comments CVPR 2026. Project page: https://refkxh.github.io/BiCo_Webpage/
匹配与融合:从无结构图像集实现一致生成
AI总结 本文提出Match-and-Fuse方法,通过图模型实现无结构图像集的一致生成,利用内部特征融合和密集输入对应关系,在无需掩码或人工监督的情况下生成一致且高质量的图像集。
Comments CVPR 2026. Project page: https://match-and-fuse.github.io/
OraPO:基于 oracle 的强化学习用于数据高效且事实准确的放射科报告生成
机构 * Oracle Health & AI(Oracle健康与人工智能)
AI总结 OraPO 通过 FactScore 奖励机制提升放射科报告生成效率,在受限预算下实现 SOTA 性能,使用小规模 VLM 和适度硬件,在 CheXpert Plus 数据集上取得 0.341 的 F1 分数。
Comments Accepted to CVPR 2026
域适应分割的掩码表示建模
机构 * South China University of Technology(华南理工大学) ; School of Electronic and Information Engineering, Wuyi University(武夷大学电子与信息工程学院) ; South China Agricultural University(华南农业大学)
AI总结 本文提出MRM任务,通过在潜在空间中进行表示掩码和重建,提升分割性能,适用于多种架构和域适应基准。
Comments CVPR 2026
3D-LFM:提升基础模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The University of Adelaide(阿德莱德大学)
AI总结 本文提出3D-LFM,利用Transformer的排列等变性处理不同数量的3D点,提升3D结构和相机的重建能力,实现跨领域的高泛化性能。
Comments Visit the project page at https://3dlfm.github.io for links to additional media, code, and videos. The site also features a custom GPT tailored to address queries related to 3D-LFM. Accepted at CVPR 2024