arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-06 至 2026-02-06 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2412.19755 2026-02-06 cs.AI 57%

Can MLLMs generate human-like feedback in grading multimodal short answers?

大型语言模型能否在评估多模态简答时生成类人反馈?

Pritam Sil, Pushpak Bhattacharyya, Pawan Goyal, Ganesh Ramakrishnan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本文研究了多模态简答评分与反馈问题,通过生成数据集评估了四种多模态大语言模型,展示了其在正确性预测和图像相关性评估中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05132 2026-02-06 cs.CV 57%

ARGaze: Autoregressive Transformers for Online Egocentric Gaze Estimation

ARGaze:用于在线第一人称注视估计的自回归变换器

Jia Li, Wenjie Zhao, Shijian Deng, Bolin Lai, Yuheng Wu, RUijia Chen, Jon E. Froehlich, Yuhang Zhao, Yapeng Tian

机构 * Department of Computer Science, University of Texas at Dallas, Richardson, TX, USA.(德克萨斯大学达拉斯分校计算机科学系) College of Computing, Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院计算机学院) Department of Computer Science, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系) Allen School of Computer Science, University of Washington, USA(华盛顿大学阿伦计算机科学学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 ARGaze通过自回归变换器模型,利用时间连续性提升在线第一人称注视估计的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏