arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

南开&西工大等让视频模型省掉思维链,解码从4780毫秒降至130毫秒

作者:arXivDaily编辑部 arXiv 2608.20492 cs · cs.CV

视频模型做强化学习时,一组采样答案可能全都不够好,模型只能在一堆错误里挑相对高分者。南开大学、西北工业大学、中科院自动化所和南开深圳研究院提出OraRL,把每条人工标注直接序列化成一条“标准轨迹”,同时保留模型自己的探索。Video-ORA-9B不生成思维链时,答案解码中位延迟从4780毫秒降到130毫秒。

它不是简单把标准答案塞进GRPO采样组。直接混入一个高奖励答案会抬高组平均值,让原本优于模型平均水平的轨迹变成负优势,论文把这一现象称为“优势反转”。

标准答案进入训练组会先制造反转

监督微调只把标注当唯一目标,不能区分接近正确和完全错误的输出;普通GRPO用标注计算奖励,却不直接学习标注轨迹。OraRL保留两者的优点:模型轨迹单独计算不含标准答案的基线,标准答案与模型之间的差距再控制额外引导强度。

项目页Figure 2:OraRL不让标准答案抬高模型轨迹的优势基线。

训练还做符号平衡裁剪,只留下标准答案以及正负两侧最强的模型轨迹,减少反向传播数量。标准答案提供稳定正目标,保留下来的失败轨迹继续承担探索和对比作用。

一套规则覆盖七类视频感知任务

项目页Figure 3:无标准答案基线、差距引导和符号平衡裁剪组成一次更新。

Video-ORA从8亿参数扩展到90亿参数,任务包括时间定位、空间定位、分割、跟踪、时空定位、视频问答和空间智能。标注可以是时间区间、边界框、掩码、轨迹或答案,只要能序列化成模型输出,并用标量奖励评估,就能进入同一训练流程。

论文报告,从8亿到90亿四个规模,OraRL都超过对应Qwen3.5骨干;最多使用10万条提示时仍继续受益。方法目前假设标注明确且可序列化,对模糊、部分正确或含噪监督的表现没有验证。

速度与七组结果同时改善

项目页Figure 1:Video-ORA-9B在七类共同覆盖任务上的代表样例和家族级成绩。

相对各任务此前最佳方法,时间定位mIoU从62.5升至66.0,跟踪AO从73.0升至78.2,分割从64.3升至70.4,三项空间智能基准宏平均从51.0升至56.1。VSI-Bench上,Video-ORA-9B为73.1,论文列出的GPT-5和Gemini-3-Pro分别为55.0与55.1。跨模型比较依赖论文统一协议,不等于所有视频能力全面领先。

项目页Figure 7:OraRL训练时间与无思维链回答的推理延迟对比。

OraRL每步耗时约为监督微调的2.2倍,低于带思维链GRPO的4.9倍。十分钟视频、2fps采样的测试里,Video-ORA与骨干首Token时间接近,主要差距来自后续生成:前者中位13.5个答案Token,思维链版本约808.5个推理Token。

训练裁剪也有明确取舍。保留四条轨迹时,单步时间从92.5秒降至62.4秒,平均分只下降0.4;裁剪到只剩标准答案和一条模型轨迹后,正负对比消失,平均分降到60.2。效率来自保留足够对比而非一味减少采样。

OraRL不要求所有任务共享同一种奖励函数。边界框、时间段、掩码和问答各自使用对应评分,再把优势计算统一。跨任务训练因此依赖奖励尺度校准,某一任务奖励过陡时仍可能主导更新。

下一步处理不完美标注与复杂推理

当前实验覆盖两类骨干和七类任务,复杂空间推理仍落后于部分闭源模型。后续需要让“标准轨迹”容纳多个合理答案、弱标注和学习型奖励,并检验裁剪是否会错过有价值的探索。项目页已展示方法和结果,代码、数据及模型链接中部分当前不可访问,文章不据此宣称完整开源包已可用。

用于生产视频分析时,还要把130毫秒的答案解码与约24秒首Token等待分开看。论文十分钟视频测试的主要开销仍在视频编码和首Token阶段,去掉思维链解决的是回答展开成本,不代表整条请求已达到实时。

参考资料

https://arxiv.org/abs/2608.20492

https://arxiv.org/pdf/2608.20492

https://orarl.github.io/