arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

小米汽车、复旦等实测41种方案:机器人隐式动作到底什么最重要

arXiv 2608.19613 cs · cs.CV · cs.RO

机器人视频很多,带精确动作标签的数据却很少。小米汽车、复旦大学、清华大学、武汉大学等机构联合发表这项系统实证研究:在统一框架中比较41种隐式动作模型设计,追踪哪些选择真正改善下游操作,而不只让视频重建指标更漂亮。

研究覆盖三类设计维度、4种代理指标、3个常用基准,并加入真实机器人操作验证。最稳定的结论是,用隐式动作先微调视觉语言模型主干,再学习物理动作策略,通常能提供更强的初始化。

隐式动作把无标签视频变成训练信号

普通视频只有连续画面,没有机器人关节角、夹爪状态或末端轨迹。隐式动作模型从相邻帧变化中提取一个紧凑变量,用它描述“发生了什么动作”,让海量人类或机器人视频能进入动作学习流程。

现有方案差异很大:有的通过逆动力学从前后帧推断动作,有的直接预测未来,有的使用光流、RGB差分或视觉特征差分作为显式目标。各论文使用不同数据、主干和策略头,单看公开分数很难判断收益究竟来自哪个组件。

统一实验框架把隐式动作研究拆成表示、正则与动作预测三部分

研究在统一流程中比较隐式动作范式、学习目标与正则方式,以及物理动作预测架构。

团队把代表性方法放进同一自动编码框架,固定数据和训练流程,分别改变隐式动作建模、学习目标与正则化、动作整合策略。41组设计因此能在同一坐标系里比较。

先学“视频中的动作”,再接真实控制

完整流程分三阶段。第一阶段从无标签视频学习表示;第二阶段把隐式动作加入视觉语言模型微调;第三阶段在有真实动作标签的数据上学习下游策略。研究重点不是让隐式变量直接控制机器人,而是检验它能否改善主干网络的动作理解。

隐式动作可被压成离散原型、连续向量或带正则的分布。团队比较重建、平滑、稀疏和分布约束后发现,没有一种代理目标能脱离下游任务独立决定优劣。过分追求视频重建可能保留背景、光照等细节,却未必保留抓取需要的运动信息。

真实机器人任务用于检查统一结论能否走出离线基准

项目页展示了抽屉、堆碗和放置积木等真实操作任务。

真实任务包括开关抽屉、堆放物体和放置方块等桌面操作。它们要求策略把视觉变化映射到可执行动作,比只预测下一帧更接近机器人最终用途。

下游成功率比代理指标更可信

论文评估4种隐式动作质量代理指标,并检查它们与下游操作性能的相关性。结果表明,一些容易计算的重建或表示指标只能解释部分变化,不能稳定替代真实策略训练。

更可靠的实验方式是把候选设计接入相同VLM和动作头,再比较控制结果。研究报告,用隐式动作微调VLM主干比仅训练独立动作模块提供了更好的策略初始化;这一趋势在三个基准和实机任务中得到验证。

不同训练规模下的四项真实任务成功次数

项目图对比普通微调与加入隐式动作调优后的实机任务成功次数。

这并不表示41种组合中存在一个适用于所有机器人的固定冠军。动作维度、视频域、机器人本体和标注量变化后,最优正则强度与整合方式仍会移动。论文的价值在于给出可重复的消融顺序,而不是一条无需调参的配方。

下一步:建立能预测操作效果的评价方法

隐式动作研究的下一步,是让离线指标更接近真实控制。若每次选模型都要完整训练机器人策略,成本会很高;但只看重建误差又可能选错方向。更好的代理指标需要对动作可分性、时间一致性和本体适配同时敏感。

四种代理指标与下游操作性能的相关性分析

相关性图用于检查代理指标是否能稳定预测下游机器人表现。

无标签人类视频仍是最具规模的数据来源。要把它们用于不同机械臂或移动机器人,还需要处理视角、手部与夹爪形态差异,并把隐式动作与语言目标、触觉和状态数据对齐。

项目页公开了实验框架和图表,可用于复核41种选择。当前结论来自有限基准与受控实机任务,部署到工业产线、汽车或家庭环境前,仍需在新的本体和安全约束下重新验证。

参考资料

https://arxiv.org/abs/2608.19613

https://carldegio.github.io/latent_action.github.io