Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned
机构 * AI Singapore(AI新加坡) ; Nanyang Technological University(南洋理工大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI