Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
在大型音频-语言模型中扩展音频上下文以实现长形式理解
机构 * Chulalongkorn University(朱拉隆功大学) ; SCB 10X ; SCBX Group(SCBX集团)
专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Partial YaRN和VLAT,通过扩展音频上下文提升大型音频-语言模型对长形式音频的理解能力。
Comments EACL 2026. Code and dataset are available at: https://github.com/yophis/partial-yarn