长视频编辑智能体要连续做素材选择、剪切、排序、字幕和导出,最终成片出炉后才得到好坏评价。阿里巴巴、中国科学技术大学等机构提出GRPB,把同一任务多版成片的相对排名,重新分配给中间编辑片段,用于训练9B参数的Crayotter。
论文图1:同一任务的多个成片可以排序,但终局名次需要被定位到具体编辑片段。
固定素材和要求后,主观评价才可比较
不同客户、素材和制作要求之间,一分之差没有统一含义。GRPB只在同一任务内部比较多个候选剪辑,把排序转成总和为零的优势值:更好的版本得到正信用,更差版本得到负信用。
系统再用分配器把信用放到语义编辑片段。导出是否成功、操作是否可执行等过程反馈在片段末端加入,成片偏好与可验证的编辑行为因此进入同一训练管线。
论文图2:过程反馈和同任务成片偏好在片段边界汇合,再用于策略更新。
分配器慢一拍,避免拿当前判断训练当前样本
如果分配器一边评价当前轨迹,一边立即被同一批结果更新,它可能把噪声放大。GRPB使用滞后一版分配器给当前批次分信用,当前比较结果只训练下一批使用的版本。
信用还受到上限与守恒约束。每条轨迹得到的总预算保持不变,同一任务组内正负压力精确相抵;可靠性不足时,系统减少或停止传递偏好信用。
论文图3:片段分数经封顶分配,轨迹预算守恒,同任务组保持零和。
15.7分高于同环境开源模型,绝对分仍低
在AgenticVBench的100项加权任务上,Crayotter-9B平均15.7分。论文同环境对照中,Qwen3.5-397B-A17B为10.9,Kimi-K3为9.3,Gemma-4-31B-it为7.9。匹配9B消融中,GRPB也高于过程PPO和终局排名PPO。
论文图4:训练曲线同时跟踪价值损失、有效导出率、分配器准确率和信用可靠性。
15.7仍是较低的绝对分数。基准使用Claude Opus 4.7和Gemini 3.1 Pro作为裁判,并按四类能力加权;盲法人评提供补充证据,但样本和任务仍来自受控套件。论文展示的是延迟主观反馈的一种训练方法,不是可稳定替代人类剪辑师的产品。