Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
边看边说:解锁多模态大语言模型的实时视频理解能力
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) ; Shanghai Jiao Tong University(上海交通大学) ; Ocean University of China(中国海洋大学)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV
AI总结 本文提出并行流式框架,通过三种设计解决多模态大语言模型在实时视频理解中的位置连续性约束问题,实现边看边说的实时交互。