阿里达摩院与湖畔实验室提出并开源机器人价值基础模型RynnValue。它用超过7000小时的多源机器人数据学习“当前状态距任务完成还有多远”,再把这个判断转成训练策略所需的稠密奖励。
论文的实机实验中,在线强化学习的平均成功率从52.5%升到72.5%,离线强化学习从63.8%升到82.5%。团队同时公开了代码、模型和项目页。
用时间戳代替昂贵偏好标注
通用奖励模型很难扩大,一个重要原因是常见监督信号不容易跨数据集复用。人工偏好需要比较轨迹,“完成进度”又往往依赖每项任务的定义。RynnValue把目标换成时间距离:根据视频时间戳,计算某个观测到语言指定目标还需要多少步。
这类标签可以直接从已有轨迹中产生。团队整合了167万条原始轨迹,经子任务分割和重标后得到约300万个带指令片段,覆盖不同机器人形态、视角和操作域。
RynnValue的实机评测覆盖抓取、空间操作与带关节物体交互。
一次前向计算同时判断绝对距离和相对变化
模型以语言指令和多帧观测为输入,在同一次前向计算中回答两类问题:当前距终点多远,以及两个观测之间是更接近还是更远离目标。相对判断让模型能识别“动了,但动错了”的轨迹。
为避免模型只记帧序和采样间隔,训练中加入随机时间采样、时序打乱与价值隔离注意力。还有一个语言分支负责视频分析和指令匹配,防止模型忽略任务文本。
RynnValue同时预测绝对时间距离和观测间的相对位移。
不标偏好,排序分数仍超过偏好监督方案
在面向未见任务、机器人和视角的RBM-EVAL-OOD上,RynnValue的平均Kendall相关系数为0.675,高于完全使用偏好监督的对比方法0.655,也高于只学进度的方法0.292。案例中,机器人一度远离有效状态时,RynnValue的价值曲线明显下降,而对比模型仍然平坦。
论文显示,扩大任务多样性带来的误差降低更快,单纯堆叠轨迹数量较早饱和。
团队还比较了数据规模的两个轴:固定任务集后增加轨迹,以及增加任务种类。后者的误差曲线下降更快,说明对通用价值模型而言,“看过更多种事情”比在少数任务上反复看更多轨迹更有用。
在指令与轨迹匹配实验中,团队将不同指令和视频交叉组合,查看高奖励是否集中在对角线。RynnValue的对角线余量更明显,说明它不是只根据“动作已经做到后半段”判分,而是检查画面中的进展是否对应当前语言目标。
消融表也检查时序打乱、价值隔离注意力、语言监督、随机采样和相对价值建模。这些组件分别防止模型依赖帧位置、其他查询的答案、固定采样间隔或单帧外观。完整配置在六个分布外机器人数据集上得到最高平均排序相关性。
下一步把时间价值接入更多机器人策略
实机强化学习覆盖四项任务,论文同时统计成功回合所需的动作块数,不只追求最终成功。密集奖励让策略在中途就获得距目标更近或更远的信号,减少了只在任务结束时得到一次成败反馈的稀疏性。
论文已将时间距离通过势函数整形转成稠密奖励,并在四项实机操作中验证了在线与离线训练收益。这些成功率仍来自论文设定的任务,不代表开放环境的通用表现。
当机器人从有效操作状态退回时,RynnValue给出更明显的价值下降。
代码、权重与数据处理资源的公开,让下一步可以直接测试它能否跨到新平台、长时程任务和更多真实家庭环境。如果时间戳监督继续保持可迁移性,奖励模型的数据建设可以少一道大规模人工偏好标注工序。
参考资料
https://arxiv.org/abs/2608.09853