Visual serial processing deficits explain divergences in human and VLM reasoning
视觉序列处理缺陷解释了人类与VLM推理之间的差异
Nicholas Budny, Kia Ghods, Declan Campbell, Raja Marjieh, Amogh Joshi, Sreejan Kumar, Jonathan D. Cohen, Taylor W. Webb, Thomas L. Griffiths
机构
*
Princeton Neuroscience Institute(普林斯顿神经科学研究所)
;
Department of Psychology, Princeton University(普林斯顿大学心理学系)
;
Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)
;
Mila - Quebec AI Institute(魁北克AI研究所)
;
Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
专题命中
视觉推理
:VLM(title,abstract);vision language model(abstract);visual reasoning(abstract);分类 cs.AI
VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation
VOST-SGG:基于视觉语言模型的一阶段时空场景图生成
Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando
机构
*
College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)
;
Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所)
;
Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)
机构
*
University of Science and Technology of China(科学技术大学)
;
Singapore University of Technology and Design(新加坡科技设计大学)
;
Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中
视觉推理
:multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV
机构
*
Om AI Research(Om AI研究机构)
;
Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)