Can MLLMs generate human-like feedback in grading multimodal short answers?
大型语言模型能否在评估多模态简答时生成类人反馈?
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 本文研究了多模态简答评分与反馈问题,通过生成数据集评估了四种多模态大语言模型,展示了其在正确性预测和图像相关性评估中的性能。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
大型语言模型能否在评估多模态简答时生成类人反馈?
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 本文研究了多模态简答评分与反馈问题,通过生成数据集评估了四种多模态大语言模型,展示了其在正确性预测和图像相关性评估中的性能。
ARGaze:用于在线第一人称注视估计的自回归变换器
机构 * Department of Computer Science, University of Texas at Dallas, Richardson, TX, USA.(德克萨斯大学达拉斯分校计算机科学系) ; College of Computing, Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院计算机学院) ; Department of Computer Science, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系) ; Allen School of Computer Science, University of Washington, USA(华盛顿大学阿伦计算机科学学院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 ARGaze通过自回归变换器模型,利用时间连续性提升在线第一人称注视估计的鲁棒性与准确性。