不止聆听,尝试规划:面向长音频会议理解的基于图的检索-生成智能体
Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding
浏览论文内容
中文总结 AI 辅助
针对长音频会议理解任务的问答数据集稀缺及现有语音模型的声学信息丢失、长期记忆差问题,构建LongAudioQA数据集,提出基于图的GRGA模型,利用智能体规划实现检索与答案生成。
中文摘要 AI 辅助
尽管长音频会议理解(LAMU)正受到越来越多的关注,但针对该任务的问答(QA)数据集仍然稀缺。现有的语音问答范式以及最先进的语音大语言模型(Speech LLMs)存在声学信息丢失和长期上下文记忆差的问题。为解决这些问题,我们构建了LongAudioQA数据集,并提出了GRGA模型,该模型将异构音频特征建模为多维图,并利用智能体规划进行检索和答案生成。
英文摘要
While long-form audio meeting understanding (LAMU) is garnering growing attention, task-specific question answering (QA) datasets remain scarce. Existing speech QA paradigms and state-of-the-art Speech LLMs suffer from acoustic information loss and poor long-term context memory. To address these issues, we construct the LongAudioQA dataset and propose the GRGA model, which models heterogeneous audio features into a multi-dimensional graph and leverages agent planning for retrieval and answer generation.
发表机构
- Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)
机构由 AI 辅助整理,请以论文原文为准。