AdaCodec: A Predictive Visual Code for Video MLLMs
AdaCodec: 面向视频多模态大语言模型的预测性视觉编码
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; JD.com(京东公司)
AI总结 针对视频帧间冗余问题,提出预测性视觉编码AdaCodec,通过条件预测代价决定是否发送完整参考帧或紧凑P-令牌,在匹配视觉令牌预算下提升性能,并大幅降低首令牌延迟。
Comments 23 pages