Learning a Particle Dynamics Model with Real-world Videos
利用真实世界视频学习粒子动力学模型
机构 * Oregon State University(俄勒冈州立大学)
AI总结 提出一种从无标签真实视频直接训练神经物体动力学模型的框架,结合高斯溅射技术,通过渲染监督学习粒子位置和旋转变化,避免对合成数据的依赖。
Comments CVPR 2026 Findings
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
利用真实世界视频学习粒子动力学模型
机构 * Oregon State University(俄勒冈州立大学)
AI总结 提出一种从无标签真实视频直接训练神经物体动力学模型的框架,结合高斯溅射技术,通过渲染监督学习粒子位置和旋转变化,避免对合成数据的依赖。
Comments CVPR 2026 Findings
GlowGS: 夜间发光场景中用于3D高斯溅射的生成式语义特征学习
机构 * National University of Singapore(新加坡国立大学)
AI总结 针对夜间发光场景中3D高斯溅射因缺乏纹理和边缘等结构特征而难以渲染高质量新视图的问题,提出GlowGS方法,利用扩散模型和视觉基础模型生成语义特征作为隐式结构线索,并通过新视图语义学习实现无真实标签的优化,显著提升渲染质量。
Comments Accepted by CVPR Findings 2026
多模态分布匹配用于视觉-语言数据集蒸馏
机构 * Visual Intelligence Lab., KAIST(韩国科学技术院视觉智能实验室)
AI总结 提出多模态分布匹配(MDM)框架,通过数据、模型和损失层面的几何感知组件,高效压缩视觉-语言数据集并保持跨模态对齐。
Comments Accepted for publication at CVPR 2026. Project Page: https://andyj1.github.io/mdm
重新思考工业检测的迁移学习:DINOv3与ImageNet预训练在RGB和X射线任务上的对比
机构 * Michelin Tyres Manufacturer(米其林轮胎制造商) ; Université Clermont Auvergne, CNRS, Institut Pascal(克莱蒙特-奥弗涅大学,CNRS,帕西尔研究所)
AI总结 本研究通过对比ConvNeXt骨干网络在监督ImageNet分类和DINOv3蒸馏预训练下的表现,评估了现代自监督预训练在工业视觉检测中的有效性,发现DINOv3在RGB任务微调后表现更优,但在X射线模态下监督预训练仍更有效。
Comments Accepted to the CVPR 2026 Workshop on Vision Foundation Models for Industrial Inspection (VISION'26)
VDE: 通过速度分解与估计实现无训练加速整流流模型
机构 * South China University of Technology(华南理工大学)
AI总结 提出速度分解与估计(VDE)方法,通过将模型速度分解为平行和正交分量并利用其时间可预测性和方向稳定性进行输入自适应估计,无需训练即可加速整流流模型,在图像和视频生成任务中实现显著加速且视觉质量损失极小。
Comments Accepted by CVPR 2026
单应性矩阵形式化验证的Lipschitz优化
机构 * Joby Aviation(Joby航空) ; Safe Intelligence
AI总结 提出一种利用Lipschitz优化和分段连续性对单应性矩阵进行形式化验证的方法,首次实现对投影几何变换的鲁棒性验证,在基准测试中取得最高89%加速和7%更紧的边界。
Comments 18 pages, 13 figures, 6 tables, to be published at CVPR 2026
基于自主前沿探索与VLM引导
机构 * EECS Department, University of California(加州大学EECS系)
AI总结 提出利用视觉语言模型进行高层战略决策,替代几何启发式,通过多模态提示选择最优前沿,在模拟环境中将地图覆盖率提升高达24%。
Comments 8 pages, 10 figures, CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments
语义感知引导的无人机探索:面向语言条件的三维室内建图
机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系)
AI总结 提出SAGE系统,结合CLIP语义提示与覆盖导向探索,在未知室内环境中优先发现目标物体,同时保持高覆盖率。
Comments 10 pages, 6 figures, 4 tables. To be presented at the 2nd 3D-LLM/VLA Workshop at CVPR 2026 (non-archival workshop)
VisAnalog:自然图像上视觉概念迁移的诊断套件
机构 * Arizona State University(亚利桑那州立大学) ; Luma AI ; UC Davis(加州大学戴维斯分校)
AI总结 提出VisAnalog基准,通过类比推理任务评估视觉语言模型在自然图像上迁移视觉概念的能力,发现模型在推断关系和应用变换上存在瓶颈。
Comments Accepted to the Workshop on Visual Concepts at CVPR 2026 as a non-archival report
场景重建作为3D检测的映射先验
机构 * Waymo LLC(Waymo公司) ; UC San Deigo(加州大学圣地亚哥分校)
AI总结 提出利用自动构建的密集映射先验增强3D检测,设计MPA3D框架融合多模态传感器数据,在Waymo数据集上取得新最优结果。
Comments Accepted to CVPR 2026
ProGIC:基于残差向量量化的渐进式轻量级生成图像压缩
机构 * Tsinghua University(清华大学) ; State Key Laboratory of Space Network and Communications(空间网络与通信国家重点实验室)
AI总结 提出一种基于残差向量量化的轻量级渐进式生成图像压缩方法ProGIC,通过逐级量化残差实现粗到细重建和渐进比特流,在保持感知质量的同时显著提升编码解码速度。
Comments Accepted by CVPR 2026 Findings
FireScope: 基于思维链预言机的野火风险栅格预测
机构 * ETH Zurich(苏黎世联邦理工学院)
AI总结 提出FireScope框架,利用视觉语言模型结合强化学习和视觉监督,通过推理轨迹生成野火风险栅格,在跨大陆泛化中取得显著性能提升。
Comments CVPR 2026, Project Page: https://firescope.ai/research
Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解
机构 * FAIR, Meta(FAIR,Meta) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。
Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM
改进的视觉到图表浮标关联:学习世界到图像投影
机构 * Arquimea Research Center(阿基米德研究中心)
AI总结 针对MaCVi 2026视觉到图表数据关联挑战,提出在DETR融合变压器基线中增加专用MLP(QueryMLP)来显式预测浮标水线接触点的像素坐标,从而减轻变压器的几何推理负担,在测试集上取得Overall 0.7386、F1 0.8055、mIoU 0.6718,排名第二。
Comments 5 pages, 3 figures. Technical report for the MaCVi 2026 Vision-to-Chart Data Association Challenge at the CVPR 2026 Workshop; 2nd place submission. Code: https://github.com/bcarrpe/macvi26-visionmap-querymlp
不看而见:视觉-语言基准测试真的测试视觉吗?
机构 * University of Chicago(芝加哥大学) ; Stony Brook University(石溪大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
AI总结 通过系统性实验发现,视觉-语言模型对细粒度视觉证据的依赖程度低于预期,表明当前基准测试不足以可靠评估其视觉基础能力。
Comments Accepted to GRAIL-V: Grounded Retrieval and Agentic Intelligence for Vision-Language, CVPR 2026 Workshop. accepted version