arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

GOLF:面向校准感知立体交互场估计的全局观察与局部聚焦

GOLF: Global Observation with Local Focus for Calibration-Aware Stereo Interaction Field Estimation

Minqiang Zou, Riqiang Jin, Zhi Lv, Dong Luo, Lianghai Tian, Zhenyu Zhao, Qi Xu, Tong Wu, Mochen Yu, Yao Tang

arXiv 2609.08607首次发表:更新:

发表机构

JIIOV Technology(极米科技(JIIOV))

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

GOLF通过融合全局上下文、局部采样和Plücker射线几何,利用DINOv3 ViT-H+/16与LoRA联合解码交互场,在SHOW3D挑战赛中以27.82毫米ADE获第一名。

AI 中文摘要

我们提出GOLF,这是HANDS@ECCV 2026上SHOW3D交互场估计挑战赛的冠军方案。给定同步的自我中心立体视图,任务是从21个手部关节中的每一个预测一个3D向量,指向被操作物体上的最近点。GOLF结合了密集的全局上下文、局部采样的手部/物体证据以及公共坐标系下的Plücker射线几何。我们采用带LoRA和可训练LayerNorm参数的DINOv3 ViT-H+/16,并联合解码两个交互场。我们的主模型在隐藏测试集上取得了官方得分27.61和平均ADE 27.96毫米。与一个互补的直接微调变体进行等权集成后,结果提升至官方得分27.47和平均ADE 27.82毫米,从而获得第一名。

英文摘要

We present GOLF, the first-place solution to the SHOW3D Interaction Field Estimation Challenge at HANDS@ECCV 2026. Given synchronized egocentric stereo views, the task is to predict a 3D vector from each of 21 hand joints to the closest point on the manipulated object. GOLF combines dense global context, locally sampled hand/object evidence, and common-frame Plücker-ray geometry. We adapt DINOv3 ViT-H+/16 with LoRA and trainable LayerNorm parameters, then jointly decode both interaction fields. Our primary model achieves an official score of 27.61 and a mean ADE of 27.96 mm on the hidden test set. An equal-weight ensemble with a complementary directly fine-tuned variant improves these results to an official score of 27.47 and a mean ADE of 27.82 mm, securing first place.

CommentsFirst-Place Solution for the HANDS@ECCV 2026 SHOW3D Challenge

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑