Stateful Token Reduction for Long-Video Hybrid VLMs
面向长视频混合视觉语言模型的有状态令牌缩减
机构 * NVIDIA(英伟达)
AI总结 针对混合Mamba-Transformer视觉语言模型,提出有状态令牌缩减方法,利用Mamba层的状态保持特性实现压缩而非剪枝,在25%令牌预算下实现3.8-4.2倍预填充加速,同时保持基线精度。
大厂专区
面向长视频混合视觉语言模型的有状态令牌缩减
机构 * NVIDIA(英伟达)
AI总结 针对混合Mamba-Transformer视觉语言模型,提出有状态令牌缩减方法,利用Mamba层的状态保持特性实现压缩而非剪枝,在25%令牌预算下实现3.8-4.2倍预填充加速,同时保持基线精度。
FusionFactory: 融合多LLM日志数据中的大语言模型能力
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nanyang Technological University(南洋理工大学) ; Meta Monetization AI(Meta 变现人工智能) ; NVIDIA(英伟达)
AI总结 提出FusionFactory框架,通过查询级、思维级和模型级融合策略,利用多LLM日志数据提升模型性能,在14个基准测试中均优于最佳单模型。
Journal ref TMLR 2026