ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
ROVER:基于视觉语言模型的视频递归推理用于具身任务
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; RAI Institute(RAI研究院)
专题命中 视频问答 :video reasoning(abstract);分类 cs.CV
AI总结 ROVER通过递归分解视频轨迹提升具身任务中的视频推理能力,有效减少幻觉并提高准确性。