OVI-MAP:Open-Vocabulary Instance-Semantic Mapping
OVI-MAP:开放词汇实例语义映射
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌) ; University of Zurich(苏黎世大学) ; TU Munich(慕尼黑工业大学) ; Microsoft(微软)
AI总结 本文提出OVI-MAP,通过解耦实例重建与语义推断,实现增量开放词汇3D实例语义映射,提升实时处理与零样本语义标注能力。
大厂专区
OVI-MAP:开放词汇实例语义映射
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌) ; University of Zurich(苏黎世大学) ; TU Munich(慕尼黑工业大学) ; Microsoft(微软)
AI总结 本文提出OVI-MAP,通过解耦实例重建与语义推断,实现增量开放词汇3D实例语义映射,提升实时处理与零样本语义标注能力。
迭代顺序如何影响深度学习中的收敛与稳定性
机构 * Google Research(谷歌研究院) ; Department of Mathematics, Uppsala University(乌普萨拉大学数学系) ; Department of Mathematics, University of Geneva(日内瓦大学数学系)
AI总结 本文探讨了梯度更新顺序对训练稳定性与收敛的影响,通过反向SGD实验展示了在固定学习率和小批量情况下,迭代顺序改变可提升稳定性与收敛性。
GUIDE:一个用于理解和协助用户进行开放性GUI任务的基准测试
机构 * KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Oxford(牛津大学) ; Konkuk University(建国大学) ; Google Inc.(谷歌公司) ; SkillBench
AI总结 GUIDE基准测试旨在评估AI模型在开放性GUI任务中感知用户行为、推断意图和提供帮助的能力,通过120名新手用户的10种软件屏幕记录,发现模型在行为状态和帮助预测上准确率仅为44.6%和55.0%,但提供用户上下文可提升帮助预测性能达50.2个百分点。
Comments Accepted at CVPR 2026
Fus3D: 从前馈几何变换器潜在特征中解码整合的3D几何
机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学) ; Inria, Université Côte d'Azur(法国国家信息与自动化研究所,蔚蓝海岸大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出一种前馈方法,在三秒内从无结构图像集合中回归密集的Signed Distance Field,无需相机校准或后期融合。通过学习体素嵌入提取几何变换器特征,实现结构化体素潜在网格,从而生成完整的SDF。