arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

英伟达等让AI裁判一起进化,驾驶推理得分提高18.2%

作者:arXivDaily编辑部 arXiv 2610.08761 cs · cs.AI · cs.RO

论文导读

英伟达、加州大学洛杉矶分校、加州大学伯克利分校、斯坦福大学提出VeriFine,让具身AI与评分裁判交替改进。AI的新错误用于调整训练题,裁判遇到判断瓶颈时再引入人工反馈。在驾驶推理实验中,固定评分器测得成绩从60.56提高到71.61,相对增加18.2%,验证能力与策略学习形成连续反馈。

AI变强之后,旧裁判可能跟不上

一个评分器可以帮助模型找错,但训练中的错误形态会变化。模型学会解决旧问题之后,可能出现新的误判,也可能找到评分规则的空隙。一直使用同一个裁判,训练反馈未必还能准确指向下一步改进。

VeriFine把策略学习和裁判更新拆成两条相互连接的循环。策略先做任务,裁判诊断重复出现的错误,再挑选适合继续训练的样本。进步停滞、判断能力成为瓶颈时,另一条循环才开始校准裁判。

研究关注驾驶与机器人导航中的推理,包括对象位置、动作因果和决策说明。成绩衡量的是给定场景中的推理质量,不是车辆已经具备独立安全上路的证明。

图:三轮驾驶推理分与裁判相关性变化,下方展示道路和室内导航例子。

先找重复错误,再让人校准裁判

策略改进循环把反复失败的情形转成样本筛选条件,安排针对性训练。它既优先选择模型还没解决的问题,也过滤不可靠的训练目标,避免只把大量旧题再做一遍。

裁判改进循环选择有信息量的判断分歧,向人类获取指导,再通过共同校准调整评分要求。更新后的裁判接着负责下一轮样本选择和训练反馈,让新错误能进入下一轮学习。

系统采用较强教师裁判与较小学生裁判的组合。教师用于细化判断和人工校准,较小模型承接大量评分工作。论文还保留固定参考评分器比较不同轮次的策略,避免只因裁判标准变了就宣布策略提高。

图:策略改进与裁判改进两条循环,人工反馈用于校准裁判判断。

推理分提高18.2%,轨迹误差另算

驾驶推理实验进行三轮改进。固定参考评分器下,基础策略得分60.56,三轮结束依次为67.30、70.59和71.61,最终相对提高18.2%。使用最终无参考裁判评分时,成绩从68.05到83.13,两个评分口径不能混在一起。

固定策略测试集有2772条样本,与用于发现问题的锚点集分开。裁判测试标签冻结,不参与规则细化。论文也匹配不同策略的训练集规模与优化预算,让对比尽量围绕数据选择与裁判反馈展开。

裁判与人类评分的相关性随迭代提高,最终学生裁判达到0.82。驾驶轨迹平均误差从2.139米变为2.117米,变化远小于推理得分增幅。不能把18.2%写成驾驶成功率或安全性提高同样多,这些指标测量的对象不同。

图:裁判与人类评分的校准、相关性误差及候选预算对照图。

下一步,把评分更新纳入持续训练流程

论文在机器人导航上也检查了类似循环,展示了对场景中物体与位置描述的改进。更新评分能力可以帮助团队安排训练题,但仍要保留独立测试与人工核查,检验评分器是否真的更接近目标。

对于持续训练的具身系统,后续需要跟踪新错误出现时裁判多久能发现、人工反馈成本是多少,以及改进能否跨任务保持。VeriFine提供了把这几项工作接入训练流程的方式,实际部署能力仍要用对应物理任务验证。

参考资料

https://arxiv.org/abs/2610.08761

https://veri-fine.github.io/

↑