论文导读
南佛罗里达大学、普渡大学、斯坦福大学、中佛罗里达大学联合建立DriveMotion,把360位驾驶员的393小时座舱视频整理成133关键点连续动作序列。论文发现,车辆机动前窗口的手臂运动幅度是同路线稳定驾驶对照的3.4倍。它提供的是数据集与预测基准,不等于量产车已经能识别驾驶意图或控制车辆。
过去识别“做了什么”,现在预测“接下来怎么动”
多数驾驶员监测数据把短视频切成打电话、看后视镜、操作中控等类别,模型做的是动作发生后的识别。DriveMotion把问题改成连续预测:先观察8秒驾驶员关键点,再预测后续4秒的身体轨迹和头部姿态。这样的数据更适合研究接管准备、分心监测,以及手和头即将移动的迹象。
数据来自三部分。BATON提供301位驾驶员的长时间自然驾驶记录和同步车辆信号;团队整理的公开视频补充不同机位、遮挡和可见身体范围;AIDE补充驾驶行为与情绪标签。三类来源统一到10Hz、133个关键点的格式,无法看到的关节用有效性掩码标记,不用算法凭空补齐。
图1:论文Figure 2展示自然驾驶、公开视频与AIDE三类座舱来源及对应骨架序列。
为什么专挑转向和刹车前后考试
自然驾驶的大部分时间,身体动作很小。若随机抽取测试片段,“保持上一帧不动”就会成为很强的基线,真正短暂但重要的动作被大量静止片段淹没。DriveMotion用车辆CAN信号离线找到转向、变道、加速、刹车和停车的起点,再围绕这些时刻建立预测窗口。CAN只用于选窗口,不在模型推理时提供。
图2:论文Figure 3展示机动前、机动后和同路线稳定驾驶窗口,以及手腕与头部轨迹。
论文先在真实轨迹上检查这个评测前提:机动前窗口的手臂运动幅度是稳定驾驶对照的3.4倍。测试集包含6138个机动前窗口、6238个机动后窗口和4262个稳定对照窗口,且先按驾驶员身份划分数据,再挖掘事件,减少身份泄漏。
多来源训练降低跨机位误差,但手臂仍难预测
在动态锚定窗口上,学习模型相对保持不动基线把预测误差最多降低15%;增加机动相关训练片段后,由预测轨迹推导的身体部位状态F1提高44%。用完整多来源数据训练,相比只用BATON,在未见过的网络视频驾驶员上把误差降低38%。这些数字对应不同对照,不能相加成一个总提升。
图3:论文Figure 7比较真实骨架与多类模型在机动前窗口中的4秒预测;多种模型对大幅手臂动作仍预测不足。
定性结果也揭示边界:回归模型能跟住头和躯干,却常把手臂动作预测得过小;扩散模型敢于生成更大动作,但骨架位置更乱。论文报告的强项是可复现数据和评测协议,不是某个模型已经可靠读懂驾驶员意图。
下一步要把动作信号接入真实座舱评测
DriveMotion释放身份不重叠划分、固定评测子集和参考实现,便于不同模型在同一套窗口上比较。后续可以把骨架预测与视线、方向盘接触、道路场景和接管事件联合评测,同时验证不同车型、相机位置和驾驶习惯下的泛化。进入真实座舱前,还需要明确预测错误会怎样影响提醒策略,并把隐私保护、误报和漏报作为与轨迹误差同等重要的指标。
参考资料
https://arxiv.org/abs/2609.08117
https://arxiv.org/html/2609.08117