arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AnchorReasoning:长尾自动驾驶场景中的视觉定位与因果推理数据集

AnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios

Zhipeng Bao, Wenjie Zhao, Tianle Zhu, Haohua Que, Chence Yang, Geng Yuan, Qianwen Li

arXiv 2609.28366首次发表:更新:

发表机构

University of Georgia(佐治亚大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

该研究提出AnchorReasoning数据集,通过视觉定位思维链监督,提升长尾自动驾驶中VLM的推理与轨迹预测能力。

AI 中文摘要

视觉语言模型(VLM)为长尾自动驾驶提供了一种有前景的方法,但现有的驾驶数据集在将决策关键的视觉证据与推理和规划相连接方面提供的监督有限。我们引入了AnchorReasoning,一个基于WOD-E2E构建的视觉定位推理数据集,包含416,119个标注帧和395,379个决策关键元素,涵盖四个主要类别和19种细粒度类型。每一帧被组织为视觉定位思维链(VG-CoT),该链将决策关键元素的识别与定位、元素属性与含义、驾驶行动理由以及行动和轨迹规划联系起来。我们进一步开发了一种课程监督微调策略,逐步学习这些层级能力,并配有一个面向对象大小的定位度量标准,用于评估定位质量。在八个通用、具身AI和自动驾驶特定骨干网络上的实验表明,VG-CoT监督改善了定位推理和轨迹预测。在各模型中,5秒ADE和FDE分别降低了7.84和11.86,而RFS帧和簇分别提高了1.66和1.70。这些增益通过平均减少18.5个推理令牌和每帧降低0.32秒的推理延迟实现,证明了视觉定位、决策聚焦的监督对长尾自动驾驶中VLM推理和规划的价值。

英文摘要

Vision-language models (VLMs) offer a promising approach to long-tail autonomous driving, but existing driving datasets provide limited supervision for connecting decision-critical visual evidence with reasoning and planning. We introduce AnchorReasoning, a visually grounded reasoning dataset built on WOD-E2E, containing 416,119 annotated frames and 395,379 decision-critical elements across four major categories and 19 fine-grained types. Each frame is organized as a visually grounded chain-of-thought (VG-CoT) that links decision-critical element identification and localization, element attributes and implications, driving-action rationale, and action and trajectory planning. We further develop a curriculum supervised fine-tuning strategy that progressively learns these hierarchical capabilities, together with an object-size-aware grounding metric for evaluating localization quality. Experiments across eight general-purpose, embodied-AI, and AV-specific backbones show that VG-CoT supervision improves grounded reasoning and trajectory prediction. Across models, 5-s ADE and FDE decrease by 7.84 and 11.86, while RFS Frame and Cluster improve by 1.66 and 1.70. These gains are achieved with 18.5 fewer reasoning tokens and 0.32 s/frame lower inference latency on average, demonstrating the value of visually grounded, decision-focused supervision for VLM reasoning and planning in long-tail autonomous driving.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑