Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
用于视频推理的多智能体自增强强化学习
机构 * Lanzhou University(兰州大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
AI总结 该研究提出结合可训练Grounder与冻结Verifier的多智能体强化学习框架,在20亿参数规模下实现视频推理任务零样本迁移,相关指标优于同等规模基线,验证了冻结验证作为证据选择训练信号的有效性。