Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models
机构 * The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV