Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education
视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力
Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod
机构
*
Fab AI
专题命中
视觉推理
:visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.AI
机构
*
Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
National University of Singapore(新加坡国立大学)
;
Wuhan AI Research(武汉人工智能研究所)
;
Tsinghua University(清华大学)
Chatting with Images for Introspective Visual Thinking
与图像对话以进行反思性视觉思维
Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan
机构
*
NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Nanjing University(南京大学)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
空间链式思考:连接理解与生成模型以实现空间推理生成
Wei Chen, Yancheng Long, Mingqiao Liu, Haojie Ding, Yankai Yang, Hongyang Wei, Yi-Fan Zhang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Long Chen
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
FlowMind: Execute-Summarize for Structured Workflow Generation from LLM Reasoning
FlowMind: 从LLM推理生成结构化工作流的执行-总结
Yihao Liu, Ziyun Zhang, Zile He, Huaqian Cai
机构
*
Peking University(北京大学)
;
East China University of Technology(东华大学)
;
National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室)