OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs
OmniMem: 面向流式音视频大语言模型的扰动感知记忆压缩
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动) ; Department of Engineering, University of Cambridge(剑桥大学工程系)
专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出OmniMem,一种针对音视频LLM的流式记忆压缩框架,通过模态感知分配和扰动感知选择压缩KV缓存,在保持长视频理解的同时减少内存,在多个基准上提升2-4%准确率。
Comments Code: https://github.com/bytedance/SALMONN/tree/omni_mem