video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM
视频-SALMONN S:内存增强的流式音频视觉大语言模型
机构 * Tsinghua University(清华大学) ; University of Cambridge(剑桥大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 视频-SALMONN S通过引入测试时训练机制,实现高效流式视频理解,显著提升长视频任务的性能和准确性。