Temporally-Grounded Language Generation: Towards Real-Time Vision-Language Models
时间接地语言生成:迈向实时视觉-语言模型
机构 * Computer Science and Engineering Division University of Michigan(计算机科学与工程系大学米歇尔大学)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 针对实时交互环境对视觉-语言模型的时间精确性要求,提出TGLG基准任务及TRACE指标,构建VLM-TSI模型,实验显示其性能优于强基线但仍有提升空间。
Comments 16 pages